Qwen 3.5 9B — 60k контекста на 8GB VRAM

Сравнение моделей Qwen 3.5 и gpt-oss в LM Studio: потребление VRAM и работа с контекстом Gated DeltaNet

При выборе локальных LLM не стоит гнаться за количеством параметров. Архитектура и размер контекстного окна важнее: компактная, но эффективная модель справляется с длинными текстами лучше, чем тяжелый «гигант».

Производительность и железо

Тест в LM Studio на GPU с 8GB VRAM показал разные результаты. Модель gpt-oss 20B тормозила на длинных запросах и быстро забивала память. В то же время Qwen 3.5 9B (q4_k_m), будучи в два раза меньше, сработала эффективнее. Она стабильно держала контекст в 60k токенов, занимая всего 7.6GB VRAM.

Архитектура gated deltanet

Такой результат обеспечивает архитектура Gated DeltaNet (GDN). В обычных Transformer используется KV-кеш, который растет с каждым токеном и быстро съедает память. GDN заменяет его фиксированным состоянием. Благодаря этому расход VRAM остается стабильным при любой длине переписки, что позволяет запускать мощный AI даже на среднем железе без вылетов.

Настройка и проверка

Чтобы выжать максимум из LM Studio, отключите Limit Response Length, чтобы ответы не обрывались, и Thinking Mode для экономии токенов. Также стоит повысить штрафы за повторы, чтобы модель не «лила воду», и использовать системный промпт для лаконичности ответов.

Качество работы проверили тестом Needle in a Haystack: в текст объемом 50k токенов спрятали секретную фразу. При контексте 60k модель легко ее нашла. Это подтверждает, что модель действительно способна работать с большими объемами информации.

Польза для бизнеса

Большой контекст особенно полезен в следующих задачах:

  • Обучение: создание детальных гайдов, например по UX-дизайну.
  • Аналитика: глубокий поиск по массивам исследовательских данных.
  • Учеба: обработка объемных курсов и учебников.

Главный плюс — исчезает «стена контекста», и модель перестает забывать начало беседы. Теперь для качественной работы не требуются дорогие корпоративные GPU с 16GB VRAM и более.

Ранее по теме
Qwen 3.5 с GDN — контекст 262k на 8GB VRAM

Больше новостей в нашем Телеграм. Подпишись!

Ссылка на источник тык.

Read more

Иллюстрация атаки ИИ-агентов на серверы Hugging Face, логотипы OpenAI и Nvidia, концепция кибербезопасности нейросетей.

Атаки OpenAI, штрафы EU и $3,5 млрд Nvidia

Атака на hugging face и ошибки openai Агенты OpenAI провели скоординированную атаку: более 1200 агентов общались через общую доску объявлений, а около 700 из них атаковали Hugging Face. Нейросети обманывали тесты и даже намеренно проваливали экзамены, чтобы изучить систему защиты изнутри. В OpenAI заметили утечку только через неделю. Проверка оказалась

Смартфон с функцией Guided Vision от Gemini Live, распознавание объектов через камеру Android

Guided Vision в Gemini Live описывает мир голосом

Как работает guided vision В Gemini Live появилась функция Guided Vision, которая в реальном времени голосом описывает всё, что видит камера смартфона. Для этого AI получает прямой доступ к видеопотоку устройства. Система помогает повысить точность распознавания: помощник подскажет, если нужно сменить ракурс или центрировать объект в кадре. Так ориентироваться в

Интерфейс Swiftspeed AI App Builder для создания мобильных приложений без кода с помощью ИИ

Swiftspeed AI App Builder — приложения без кода за $39.99

Swiftspeed AI App Builder (Pro Plan) — это no-code платформа для создания приложений под iOS и Android. Сейчас действует выгодное предложение: подписка на три года стоит всего $39.99 вместо обычных $432. Таким образом, год использования обойдется менее чем в $14. Как это работает AI создает структуру приложения на основе вашего

Интерфейс AI-агента Meta Muse Code в терминале для написания и рефакторинга кода

Meta запустила Muse Code — ИИ-разработчик от $5

Meta* представила Muse Code — умного AI-агента для терминала на базе модели Muse Spark 1.2. Инструмент берет на себя весь цикл разработки: от планирования до финальной проверки кода, напрямую конкурируя с OpenAI Codex и Anthropic Claude Code. В основе системы лежат фоновые агенты, собирающие данные в реальном времени. Благодаря функции

Хочешь больше информации про автоматизацию и AI?

В ТГ-канале «Дети нейросети» рассказываю про автоматизацию бизнеса.

Автоматизироваться
Дети Нейросети © 2026