Какую локальную AI-модель запустить? Руководство по GPU, контексту и программированию на октябрь 2026 года
Table of Contents
Лучшая локальная модель для программирования хранит в памяти достаточную часть вашего проекта и читает её достаточно быстро, чтобы оставаться полезной. Размер модели по-прежнему важен. Модель, которая помещается только после выгрузки данных в системную RAM, часто ощущается хуже, чем меньшая модель со стабильным контекстным окном.
Выбирайте модель и объём памяти вместе. Не выбирайте модель из рейтинга, а затем не заставляйте её работать на неподходящем оборудовании.
Это руководство посвящено агентам программирования, а не коротким промптам автодополнения. Перед записью исправления агент читает файлы, вывод инструментов, ошибки компилятора и результаты тестов. Эти входные данные расходуют контекст и меняют решение по оборудованию.
Видео служит справочным материалом
Следующее видео сравнивает локальные модели на нескольких уровнях памяти GPU. Оно полезно практическими наблюдениями по выбору моделей и заявленными результатами оборудования. Эта статья организует решение вокруг поведения памяти, контекста агента, обработки промпта и полной стоимости владения.
Почему рейтинги моделей не работают
Рейтинг моделей обычно связывает число параметров с объёмом памяти GPU. Такой упрощённый подход полезен для первой оценки. Он перестаёт работать, когда агент программирования начинает читать реальный репозиторий.
Веса модели занимают память первыми. KV cache растёт по мере работы. Он хранит ключи и значения attention активного контекста, чтобы runtime не пересчитывал весь промпт после каждого сгенерированного токена.
| Потребитель памяти | Что хранит | Почему это важно |
|---|---|---|
| Веса модели | Квантованные параметры | Однократное требование загрузки |
| KV cache | Данные активного контекста | Растёт вместе с промптом и разговором |
| Буферы runtime | Временное пространство для вычислений | Зависит от backend и размера batch |
| Инструкции агента | Системные промпты и определения инструментов | Используют контекст до загрузки файлов проекта |
То, что файл модели помещается на видеокарту, не доказывает пригодность агента. Runtime нужен запас для cache, временных буферов, определений инструментов и следующего ответа.
Контекст является настоящим бюджетом
Агенты программирования расходуют контекст не только на исходные файлы. В бюджет также входят системные инструкции, схемы инструментов, списки каталогов, вывод shell, сообщения компилятора, результаты тестов и предыдущие ходы разговора.
Три MCP-подключения с подробными определениями инструментов часто занимают несколько тысяч токенов ещё до открытия агентом файла проекта. Маленький контекст по умолчанию оставляет мало места для кода. Агент продолжает отвечать, но теряет рабочий набор, необходимый для многоэтапного исправления.
Runtime FAQ Ollama
указывает контекст по умолчанию в 4 096 токенов. Параметр OLLAMA_CONTEXT_LENGTH меняет значение по умолчанию, а OLLAMA_NUM_PARALLEL увеличивает требуемую память вместе с числом параллельных запросов. Запишите оба значения перед сравнением локального бенчмарка с результатом для одного запроса.
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_NUM_PARALLEL=1 ollama serve
Этот пример задаёт значение 32K по умолчанию для одного активного запроса. Он не резервирует 32K токенов под файлы проекта. Инструкции, определения инструментов, входные и выходные данные по-прежнему используют одно окно.
Простая запись контекста
Перед сравнением GPU запишите следующие значения:
- Размер проекта: файлы и примерное число строк исходного кода в обычной задаче.
- Накладные расходы инструментов: системный промпт, схемы MCP, shell-инструменты и инструкции редактора.
- Объём ошибки: обычная длина вывода компилятора и тестов.
- Целевой контекст: самый большой промпт, который вы хотите сохранить без усечения.
- Запас ответа: место для планируемого патча и объяснения.
Используйте результат как спецификацию нагрузки. Разработчику, который меняет по одному файлу, нужен другой объём памяти, чем разработчику, который просит агента проследить API через монорепозиторий.
KV cache меняет рейтинг
Две модели с похожим числом параметров часто имеют разную стоимость контекста. Плотной модели, где каждый слой участвует в растущем cache, может требоваться больше памяти, чем модели с гибридной архитектурой attention.
Одна из обсуждаемых в справочном материале моделей программирования 27B использует ограниченный набор слоёв с полным attention, а остальные слои используют сводку фиксированного размера. Заявленная стоимость контекста 128K для cache остаётся ниже 9GB. Модели похожего размера с растущим полным attention во всех слоях, согласно отчёту, требуется более 21GB при такой же длине контекста.
Эти значения относятся к конкретным архитектурам моделей и настройкам runtime. Используйте их как повод изучить архитектуру, а не как универсальную формулу памяти.
| Поведение модели | Влияние на контекст | Следствие для оборудования |
|---|---|---|
| Полный attention в каждом слое | Большой рост cache | Нужно больше памяти для длинных промптов |
| Гибридный или sliding attention | В некоторых слоях cache растёт медленнее | Больше запаса контекста при том же размере модели |
| Mixture of experts | Меньше активных параметров на токен | Меньше вычислений на токен, но всем весам всё равно нужно хранилище |
| Расширение длинного контекста | Большее рабочее окно | Больше памяти cache и работы при обработке промпта |
Изучите архитектуру модели до покупки памяти. Одно число параметров скрывает стоимость длинного сеанса программирования.
Выбирайте по объёму памяти GPU
От четырёх до восьми GB
Небольшие плотные модели остаются практичным выбором. Они помещаются на видеокарту, быстро отвечают и хорошо подходят для автодополнения, коротких объяснений и небольших изменений файлов.
Большая модель с CPU offload может выдавать текст, но время ответа часто становится ограничением. Агент программирования постоянно читает файлы и вызывает инструменты. Конфигурация со скоростью четыре токена в секунду превращает каждое исправление в долгое ожидание, даже если модель технически запускается.
Модели mixture-of-experts дают другой вариант. Небольшая активная часть снижает вычислительную нагрузку, а полный набор весов частично находится в системной памяти. Такой подход требует большого объёма RAM и быстрых каналов передачи.
| Нагрузка | Рекомендуемое направление |
|---|---|
| Автодополнение | Небольшая плотная модель с коротким промптом |
| Изменение одного файла | Небольшая instruct-модель с поддержкой инструментов |
| Агент для всего репозитория | Сначала арендуйте более мощный GPU или увеличьте системную память |
| Приватный код под NDA | Используйте локальную модель, приняв меньший масштаб или более медленные запуски |
На этом уровне сначала купите системную RAM, а не гонитесь за большой моделью. Стабильная небольшая модель лучше большой, которая почти всё время перемещает данные по шине.
От двенадцати до шестнадцати GB
Этот уровень открывает путь к модели программирования 27B, но выбор квантования становится главным. Стандартная 4-bit сборка размером около 17GB не помещается на карте 16GB после учёта накладных расходов runtime.
3-bit сборка около 13GB оставляет больше места для контекста. Карта 12GB подталкивает к 2-bit сборке или меньшей модели mixture-of-experts. Качество зависит от конкретного квантователя и процесса калибровки, поэтому две загрузки с одинаковой разрядностью часто дают разные результаты программирования.
Перед загрузкой квантованной модели проверьте:
- Автора квантователя и примечания к выпуску
- Данные калибровки и результаты оценки
- Совместимость токенизатора
- Тесты вызова инструментов
- Длину контекста при выбранном квантовании
- Поддержку runtime в Ollama, llama.cpp или выбранном интерфейсе
«2-bit» или «3-bit» не являются полным описанием качества. Важны метод упаковки и записи калибровки.
От двадцати четырёх до тридцати двух GB
Это самый гибкий диапазон для модели программирования 27B. Карта 24GB часто вмещает 4-bit сборку с полезным контекстом, но полное окно 128K может превысить оставшуюся память. Карта 32GB даёт runtime больше места для cache и временных аллокаций.
Этот диапазон также проще оправдать как собственное оборудование. Одна GPU справляется с задачей без сложности разделения на две карты. Система потребляет меньше энергии, чем multi-GPU сборка, а поддержку ПО проще проверить.
| Объём | Практическая позиция |
|---|---|
| 24GB | Сильная 4-bit модель с измеряемыми ограничениями контекста |
| 32GB | 4-bit или 6-bit модель 27B с большим запасом контекста |
| 48GB | Более высокая точность или больший cache без смены основной модели |
Диапазон 24GB–32GB разумен для частой приватной работы с кодом. Он избегает худшего поведения offload и не требует помещать серверное оборудование в настольный корпус.
Сорок восемь GB и больше
Больший объём памяти не означает новую модель. Та же модель 27B может работать с точностью 8-bit на карте 48GB, с большим cache и меньшим числом компромиссов. Улучшения касаются стабильности, места для контекста и качества ответа, а не нового уровня рассуждений.
При 128GB решение меняется. Становится возможной гораздо более крупная модель mixture-of-experts, но обработка промпта превращается в серьёзную проблему. Модель часто генерирует быстро, но долго загружает большой репозиторий или свежий результат инструмента.
Для больших моделей измеряйте скорость prefill отдельно от скорости decode. Быстрый ответ после медленного чтения промпта всё равно ощущается медленным в рабочем процессе агента.
Скорость decode составляет только половину теста
Скорость decode измеряет число сгенерированных токенов в секунду. Она отвечает на вопрос: «Как быстро модель пишет?». Скорость prefill измеряет обработку промпта. Она отвечает на вопрос: «Как быстро модель читает?»
Агент много времени тратит на чтение. Каждый вызов инструмента добавляет новый текст. Длинный исходный файл, stack trace или журнал теста попадает в промпт до начала следующего ответа.
| Метрика | Впечатление пользователя |
|---|---|
| Токены decode в секунду | Как быстро появляется ответ после обработки |
| Токены промпта в секунду | Сколько агент ждёт до начала ответа |
| Время до первого токена | Общая задержка обработки промпта и подготовки |
| Сохранение контекста | Сколько состояния проекта остаётся доступным во время задачи |
Проводите бенчмарк на собственных размерах промптов. Короткий синтетический промпт скрывает стоимость, которая важнее всего при работе с репозиторием.
Сначала бесплатные настройки runtime
Апгрейд оборудования не является первым шагом к производительности. Проверьте настройки runtime до открытия страницы магазина.
Предсказание нескольких токенов
Некоторые сочетания модели и backend поддерживают предсказание нескольких следующих токенов с последующей проверкой за один проход. Функция часто доступна через флаг runtime или совместимую draft-конфигурацию.
Заявленные в справочном материале тесты показывают большой прирост на некоторых мощных картах. Результаты зависят от файла модели, backend, драйвера и карты. Пути Apple Metal могут не сохранить нужную функцию при конвертации.
Уровень рассуждений
Модель с максимальным уровнем рассуждений тратит больше времени на внутреннюю работу до возврата результата. Средний уровень часто лучше подходит для исправления кода, особенно если задача уже содержит ясное сообщение об ошибке и конкретный файл.
Используйте простую матрицу тестов:
- Запустите одну и ту же задачу исправления ошибки с низким, средним и высоким уровнем рассуждений.
- Запишите время до первого токена, общее время, успех патча и результат теста.
- Повторите тест с коротким промптом и промптом размера репозитория.
- Оставьте настройку, которая даёт лучшую завершённую задачу, а не максимальную скорость токенов.
Средний уровень рассуждений с совместимым путём предсказания нескольких токенов является хорошей отправной точкой. Проверьте качество на собственном коде до установки этого режима по умолчанию.
Локальное оборудование или арендованный GPU?
Аренда вычислений выигрывает для редких задач. Вы платите за активные сеансы вместо круглогодичной покупки, установки охлаждения, обновления и питания карты.
Собственное оборудование выигрывает при частой, приватной или офлайн-работе. Оно также убирает время ожидания в очереди и даёт стабильную среду для повторяемых тестов.
| Ситуация | Лучший первый шаг |
|---|---|
| Несколько сеансов в месяц | Арендуйте GPU или используйте API |
| Ежедневное приватное программирование | Купите подходящую систему на 24GB–32GB |
| Большой репозиторий с частыми перезагрузками | Сначала арендуйте и измерьте скорость prefill |
| Код не покидает здание | Владейте минимальной системой, которая достигает цели по контексту |
| Эксперименты с новой моделью | Арендуйте до покупки оборудования |
Считайте точку окупаемости по активным часам, а не по календарным. Включите электричество, хранилище, охлаждение, обслуживание и время на поддержание runtime в рабочем состоянии.
Мощный GPU, купленный для редких экспериментов, является расходом на хобби. Система 24GB–32GB для ежедневной приватной работы имеет более убедительное экономическое обоснование.
Улучшенный список покупок
Сравнивая модель и GPU, действуйте в таком порядке:
- Определите задачу. Автодополнение, исправление одного файла, агент репозитория или анализ с длинным контекстом.
- Измерьте промпт. Посчитайте обычные системные инструкции, схемы инструментов, файлы и вывод тестов.
- Изучите поведение cache. Найдите сведения об архитектуре и измерения памяти контекста.
- Выберите квантование. Проверьте результаты качества конкретной загрузки, а не только число битов.
- Проверьте prefill и decode. Используйте промпты из собственного репозитория.
- Настройте рассуждения. Сравните время завершённой задачи на нескольких уровнях рассуждений.
- Проверьте приватность и обслуживание. Уточните, куда отправляется исходный код и кто поддерживает backend.
- Сравните стоимость аренды. Используйте ожидаемые активные часы и включите электричество в оценку собственной системы.
Итоговая рекомендация
Ниже 12GB запускайте меньшую модель или модель mixture-of-experts с достаточной системной RAM. Не заставляйте плотную модель 27B работать в конфигурации, которая большую часть времени тратит на offload.
При 12GB–16GB сосредоточьтесь на качестве квантования и контролируемой цели по контексту. Хорошо протестированная 2-bit или 3-bit сборка с поддержкой инструментов полезнее 4-bit файла, который не помещается без проблем.
При 24GB–32GB модель программирования 27B становится практичным стандартом для ежедневной приватной работы. Измерьте использование контекста и скорость промпта, прежде чем считать доступным всё заявленное окно.
При 48GB и больше потратьте дополнительную память на точность, место для cache и стабильные сеансы до перехода на более крупную модель. После перехода модели в область 128GB скорость чтения промпта и экономика аренды требуют больше внимания, чем сырая ёмкость.
Название модели является только началом. Полезный вопрос звучит так: сколько контекста проекта остаётся после того, как модель, runtime, инструменты и cache заняли свои части?
Дополнительное чтение
- 32GB VRAM для Qwen 27B: руководство по оборудованию для локального AI , посвящено вариантам оборудования для нагрузки 27B.
- Бенчмарки GPU Llama 3.1 8B и Qwen3.8 27B на Vast.ai , измеренные результаты арендованных GPU и ограничения длинного контекста.
- Локальный AI в 2026 году: модель 27B превосходит Sonnet 4.6 , качество модели, квантование и экономика локального оборудования.
This article refers to other articles we've written:
-
32 ГБ VRAM для Qwen 27B: руководство по локальному AI-железу на октябрь 2026 года
Практическое руководство за октябрь 2026 года по запуску модели Qwen 27B с 32 ГБ доступной памяти ускорителя. Сравните одиночные GPU, сборки с двумя картами, унифицированную память, бывшие в употреблении серверные карты, аренду вычислений, поддержку ПО и ограничения полного контекста.