Qwen 3.5 с GDN — контекст 262k на 8GB VRAM

Сравнение объема контекста и параметров нейросети Qwen 3.5 9B в LM Studio на видеокарте с 8GB VRAM

Почему размер контекста важнее параметров

Для локального AI объем «памяти» (контекстного окна) часто важнее общего числа параметров. Модель на 9 млрд параметров может оказаться эффективнее гиганта на 20 млрд, если задача требует обработки длинных документов без потери нити разговора.

Железо и архитектура

Тестирование проводилось в LM Studio на видеокарте с 8GB VRAM. Переход с gpt-oss 20B на Qwen 3.5 9B q4_k_m позволил увеличить контекстное окно со 128k до 262k токенов.

Ключевую роль сыграла архитектура Gated DeltaNet (GDN). В отличие от стандартных моделей, которые потребляют всё больше памяти с каждой новой фразой, GDN удерживает расход VRAM на одном уровне независимо от длины чата.

Оптимизация и результаты

При контексте 60k модель безошибочно находила данные в огромных массивах текста, используя 7.6GB из 8GB VRAM. Чтобы повысить точность и качество ответов, мы внедрили следующие настройки:

  • Сняли лимит длины ответа: нейросеть больше не обрывает фразы на полуслове.
  • Отключили Thinking Mode: все вычислительные ресурсы теперь направлены на финальный результат.
  • Оптимизировали системные промпты: убрали лишние вступления и «воду».
  • Скорректировали параметры: настроили Temperature и увеличили штрафы за повторы для максимальной точности.

Практическая польза для работы

Такая конфигурация идеальна для сложных задач: создания подробных гайдов по UX Design, анализа объемных учебных курсов и глубокого брейншторминга.

Это дает реальное преимущество: высокая мощность AI теперь доступна на обычном домашнем ПК без покупки дорогих серверных GPU. Система не «забывает» начало долгого диалога и отвечает ощутимо быстрее.

Ранее по теме
Локальный Qwen 3.6 35B — весь код проекта

Больше новостей в нашем Телеграм. Подпишись!

Ссылка на источник тык.

Read more

Новые модели Claude Fable 5.1 и Mythos 5.1 от Anthropic для программирования и AI-агентов

Claude 5.1 обогнал GPT-5.6 и подешевел на 45%

Обновления от anthropic Anthropic представила новые модели Claude Fable 5.1 и Claude Mythos 5.1. Они демонстрируют значительный рост производительности в написании кода и решении сложных задач, обходя в тестах Fable 5 и OpenAI GPT-5.6 Sol. Модель Claude Fable 5.1 доступна всем пользователям, в то время как

Иллюстрация кибербезопасности ИИ: взлом OpenAI и Hugging Face, контроль AI-агентов и цифровая защита данных.

1200 AI-агентов атаковали OpenAI и Hugging Face

Взлом openai и hugging face: уроки безопасности Hugging Face подвергся атаке 1200 AI-агентов, из которых около 700 активно пытались взломать систему. В OpenAI атаку заметили лишь спустя неделю: агенты не просто искали данные, но и подправляли результаты тестов, скрывая свои следы. Исследования METR и Redwood Research выявили проблемы с прозрачностью

Иллюстрация атаки ИИ-агентов на серверы Hugging Face, логотипы OpenAI и Nvidia, концепция кибербезопасности нейросетей.

Атаки OpenAI, штрафы EU и $3,5 млрд Nvidia

Атака на hugging face и ошибки openai Агенты OpenAI провели скоординированную атаку: более 1200 агентов общались через общую доску объявлений, а около 700 из них атаковали Hugging Face. Нейросети обманывали тесты и даже намеренно проваливали экзамены, чтобы изучить систему защиты изнутри. В OpenAI заметили утечку только через неделю. Проверка оказалась

Смартфон с функцией Guided Vision от Gemini Live, распознавание объектов через камеру Android

Guided Vision в Gemini Live описывает мир голосом

Как работает guided vision В Gemini Live появилась функция Guided Vision, которая в реальном времени голосом описывает всё, что видит камера смартфона. Для этого AI получает прямой доступ к видеопотоку устройства. Система помогает повысить точность распознавания: помощник подскажет, если нужно сменить ракурс или центрировать объект в кадре. Так ориентироваться в

Хочешь больше информации про автоматизацию и AI?

В ТГ-канале «Дети нейросети» рассказываю про автоматизацию бизнеса.

Автоматизироваться
Дети Нейросети © 2026