NagibakaFrontend, боты, автоматизация

Урок

1.2 Какие модели подходят для кодинга? Шпаргалка по типам моделей: Instruct, Thinking, Densed, Multi-modal, MOE, MTP, MLX, квантизация

Написано человеком0% LLM

Одному своему коллеге я все уши прожужжал на тему того, что пусть он попробует LLM для решения своей задачи по написанию кода для одной достаточно большой фичи. В итоге он сдался и попробовал, после чего, он долго плевался и недоумевал, насколько нейронка глупая. Я ему ничего не объяснял и не рассказывал, думал сам разберется. В итоге оказалось, что он использовал модель ChatGPT 4-mini для кодинга, это очень маленькая и глупая модель для подобных задач. По этой причине, я решил, что данная статья не будет лишней.

В мире LLM-моделей легко запутаться - их стало очень много. Даже если вы используете подписки - то вам все равно нужно понимать, какая модель для чего предназначена и для каких задач будет достаточно той или иной модели. Вы, конечно, можете для любых задач использовать самую умную модель - но это не эффективно. Топовые жирные модели обычно работают в 2-5 раз медленнее, чем их младшие братья и сестры. Для задачи перевода обычного текста - нет смысла использовать топовую модель, средняя справится также, но в 3 раза быстрее и существенно дешевле. Это как доктора наук заставить решать школьную таблицу умножения.

Если же говорить о локальных моделях - то тут точно нужно хорошо разбираться во всем многообразии, поскольку вам предстоит найти лучшие модели на доступное вам железо. И здесь вы в полной мере ощутите разницу, например, между двумя моделями на 27 миллиардов параметров, одна из которых обучалась почти полностью на чужом коде, а вторая модель общего назначения со встроенным Vision. При написании кода, разница между ними будет космическая.

Какие вообще модели бывают?

Gemini_Generated_Image_y1x5wry1x5wry1x5.png

Модели бывают очень разные, и я хочу вам рассказать об основных вещах, которые необходимо знать.

По назначению и логике работы (Типы взаимодействия)

  • Instruct (Инструктивные)
    Такие модели не имеют рассуждающего блока и поэтому быстро отвечают. Они не продолжают текст, а просто отвечают на запрос пользователя. Такой тип моделей уже устарел, но для некоторых кейсов его по-прежнему использовать эффективно.

  • Thinking / Reasoning (Рассуждающие)
    У рассуждающих моделей есть скрытый этап размышления перед выдачей ответа. Его длительность может отличаться в зависимости от задачи и настроек модели. Эти модели используют цепочки рассуждений (Chain-of-Thought) для решения сложных логических задач.

  • Multi-modal (Мультимодальные)
    Мультимодальные модели могут обрабатывать не только текст, но также изображение, аудио и иногда даже видео. В контекст вы можете одновременно загрузить тексты и изображения, например. Некоторые модели могут не только принимать разные типы данных, но и генерировать и возвращать текст, изображения, аудио и видео.

    На скрине пример маленькой модели Qwen 3.5 9B, умеющей распознавать изображения, думать и вызывать tools(Capabilities: Vision, Tool use, Reasoning).

image.png

По архитектуре и структуре весов

  • Dense (Плотные)
    Это классическая архитектура нейросетей. Для кодинга это замечательно - глубже понимание, чем у MoE, такого же размера. У подобных моделей каждый токен (слово) активирует 100% параметров модели.

    Пример: Qwen 3.6 27B

  • MoE (Mixture of Experts / Смесь экспертов)
    Такие модели состоят из большого количества слоев, которые называются экспертами в разных областях. Для каждого токена роутер активирует только часть экспертов (например, 3 из 35). Активация сразу всех экспертов невозможна by design.

    Главное преимущество подобного подхода - это скорость работы. Но, несмотря на то, что мы одновременно используем, например, только три эксперта, нам все равно необходимо держать в памяти всех доступных экспертов.

    Пример: Qwen3.6-35B-A3B - 3 активных эксперта из 35

По методам оптимизации и форматам

  • MTP (Multi-Token Prediction / Предсказание нескольких токенов)
    Это архитектурный подход, где модель предсказывает не один следующий токен, а сразу несколько. Такой подход ускоряет генерацию текста и улучшает понимание долгосрочного контекста. Позволяет увеличить скорость генерации токенов на 20-200% в зависимости от сложности и рутинности задачи

    Пример: Qwen 3.6 27B MTP

  • Quantization (Квантизация)
    Квантизация - это процесс сжатия модели путем снижения точности числовых весов (например, из 16-бит в 8-бит, 4-бит или даже 1.58-бит). Обычно для домашнего железа выбирают вариант, типа Q4_K_M - это обычно самый оптимальный вариант. Например, Q8_0 будет почти без сжатия и без потерь качества, но потребует сильно больше видеопамяти.

    Модель - это набор чисел с плавающей точкой, квантизация обычно уменьшает количество знаков после запятой у этих чисел, было 0.3456783945673456, а стало 0.34567839, вместо 16 знаков стало 8 после запятой. Исходный вес модели был 32Гб - стало 8Гб, например.

    Скорость генерации модели упирается в пропускную способность памяти(VRAM). Чтобы сгенерировать 1 токен, нужно прочитать все веса модели. Чем больше модель - тем дольше она будет считываться из памяти.
    Для примера возьмем видеокарту nVidia RTX 5090 32GB с пропускной способностью памяти в 1792 Гб/сек. . Допустим модель весит 16 Gb. Значит можно очень грубо прикинуть, что модель размером 16 Гб будет иметь скорость генерации(1792/16=112) примерно 112 токенов/секунду, что супер-комфортно для кодинга и быстрее моделей по подписке.

    Квантизация позволяет запускать даже очень жирные модели на домашнем железе, а некоторые модели даже на смартфонах. Для квантизации Q4 - потери качества могут составлять 5-10%.

image.png
  • MLX
    Это специализированный фреймворк от Apple для эффективного запуска и обучения моделей. Дает прирост в скорости генерации токенов в 20-40%. Оптимизирован под чипы Apple Silicon (M1/M2/M3/M4/M5+).
    Модели в формате MLX используют общую память (Unified Memory) Mac на максимальной скорости.

image.png

Облачные модели для кодинга по подписке Anthropic(Claude Code), ChatGPT(Codex)

Не буду тут подробно останавливаться. Эти топовые модели используются в том числе для создания новых версий самих себя. Они универсальные - подходят для задач кодинга и для любых других задач.

Хочу вам показать табличку на примере ChatGPT, обратите внимание на скорость.

Сравнение моделей линейки GPT-5.6(31.07.2026)

Модель

Скорость генерации (в среднем)

Стоимость (вход / выход за 1M токенов)

Главное отличие в задачах и назначение

Пример идеального сценария

GPT-5.6 Sol (Флагман)

~45–70 токенов/сек (До 2.5× быстрее в режиме Fast)

$5.00 / $30.00

Сложные многоуровневые рассуждения, глубокий аудит кода, тяжелая аналитика.

Архитектурное планирование, поиск скрытых уязвимостей, комплексный финтех-анализ.

GPT-5.6 Terra (Баланс)

~100–120 токенов/сек

$2.50 / $15.00

Универсальная «рабочая лошадка». Оптимальна для стандартной бизнес-логики и работы с текстом.

Написание и редактирование статей, контент-планы, рутинный рефакторинг кода.

GPT-5.6 Luna (Скорость)

~181 токенов/сек (Одна из самых быстрых на рынке)

$1.00 / $6.00 (Дешевле аналогов на 80%)

Сверхбыстрые фоновые задачи, цикличные вызовы в цепочках ИИ-агентов.

Поддержка чат-ботов в реальном времени, структурирование больших данных, массовый парсинг.

У Anthropic(Claude Code) - картина сопоставимая.

Локальные или корпоративные модели для кодинга Qwen 3.6 27B и Qwen 3.6-35B-A3B

Ловите небольшую таблицу для сравнения.

Сравнение Qwen 3.6 27B и Qwen 3.6-35B-A3B

Характеристика / Критерий

Qwen 3.6 27B (Dense)

Qwen 3.6-35B-A3B (MoE)

Архитектура

Плотная (Dense) (Все 27 млрд параметров активны всегда)

Смесь экспертов (MoE) (35B всего / только 3B активных параметров)

Скорость генерации (Tokens per Second)

~25–40 токенов/сек (До 160 т/с на топовых GPU с MTP)

~105–135 токенов/сек (До 240+ т/с на топовых GPU с MTP)

Скорость обработки инпута (Prefill Speed)

~800–1000 токенов/сек

~3000+ токенов/сек (В 3 раза быстрее обрабатывает контекст)

Требования к VRAM (Для локального запуска)

~18–28 ГБ (Комфортно помещается в 24 ГБ в кванте Q4_K_M)

~24–38 ГБ (В режиме FP8/Q8 требует больше видеопамяти)

Сила в задачах

Глубокая логика, безошибочный кодинг, сложные агентские цепочки, строгое следование длинным инструкциям.

Сверхбыстрые ответы, RAG (работа с базами знаний), многопользовательские чаты, первичный парсинг данных.

Поведение при нехватке VRAM

Падение скорости не столь критично, можно частично выгрузить в RAM.

Скорость резко падает, если «эксперты» MoE не помещаются в VRAM целиком.

Для локального кодинга - Qwen - фаворит. Но также вы можете рассмотреть Deepseek и GLM.

Не буду перегружать ваш лишней информацией - этого пока будет достаточно.