Локальный ИИ и ChatGPT: насколько мы близки?
Table of Contents
Локальный ИИ подходит для ограниченных задач с понятными проверками. Замена работы, которую вы передаёте ChatGPT или Claude, требует трёх совпадающих условий: возможностей модели, доступной памяти и агента, который проверяет результат.
Модель, помещающаяся в рабочую станцию, всё равно нуждается в инструментах и скорости для повторных попыток. Статья отдельно рассматривает результаты тестов, оценки памяти и доказательства выполненных задач.
Главные выводы
- Возможности: эталонные баллы описывают конкретные условия, а не локальную квантованную сборку.
- Память: учитывайте веса, кэш контекста и накладные расходы среды.
- Скорость: повтор разговора агента измеряет обслуживание, а не правильность.
- Проверка: проверки должны соответствовать требуемому результату.
- Выбор: до покупки сравните повторяемые задачи, время исправления и общую стоимость.
Читайте баллы в контексте
Artificial Analysis Intelligence Index объединяет несколько оценок в справочный балл. Таблица моделей и результаты локального оборудования показывают записи, проверенные 6 октября 2026 года.
| Модель и настройка | Балл | Развёртывание в сравнении |
|---|---|---|
| Qwen3.8 27B, xhigh | 34 | Загружаемые веса |
| GLM-5.3, max | 45 | Загружаемые веса |
| GPT-6 Astra, max | 53 | Размещённая служба |
| Claude Opus 5.5, max с fallback | 58 | Размещённая служба |
Баллы индекса не являются процентами интеллекта или успеха задачи. Разница в 13 баллов между GLM и Claude не доказывает разницу в 13% при программировании. Настройка рассуждений также влияет на сравнение одной модели.
Опубликованная методика описывает условия теста. Некоторые оценки включают инструменты и инфраструктуру агентов. Считайте балл результатом внутри этих условий. Не переносите его напрямую на сжатую локальную копию в другом приложении.
ChatGPT и Claude являются продуктами, а таблица сравнивает выбранные базовые модели. Подписка, модель, доступные инструменты и контекст задачи создают дополнительные различия. Начните с повторяемой задачи и проверьте весь набор.
Планируйте память всего запроса
Соответствие памяти начинается с трёх частей. Веса хранят параметры модели. Кэш ключей и значений, или KV-кэш, хранит данные внимания. Буферы среды и другое ПО используют оставшееся место.
Required memory = resident weights + context cache + runtime allowance
Available memory = physical capacity - operating system and application reserve
Квантизация уменьшает точность хранения весов. Меньшая точность уменьшает требования к памяти, а качество зависит от модели и сборки. Точность кэша задаётся отдельно. Файл весов Q4 не доказывает наличие четырёхбитного кэша.
Для грубой оценки 27 миллиардов параметров при 16 битах требуют около 50,3 GiB. Восемь бит дают 25,1 GiB, четыре бита дают 12,6 GiB. Размеры опубликованных файлов также включают метаданные, упаковку и смешанную точность. Для планирования используйте точные файлы.
Карточка Qwen3.8-27B и карточка GLM-5.3 описывают разные архитектуры. Модель mixture-of-experts активирует только часть параметров для каждого токена, но остальные веса всё равно нужно хранить. Offloading меняет размещение и задержку, но не удаляет веса.
Начните с опубликованных файлов
Размер загрузки даёт более конкретную отправную точку, чем число параметров. Сборки Qwen и GLM от Unsloth показывают влияние выбранной квантизации.
| Квантованная сборка | Опубликованный размер, десятичные GB | Примерно GiB |
|---|---|---|
| Qwen3.8 27B Q4_0 | 16.1 | 15.0 |
| Qwen3.8 27B Q8_0 | 29.0 | 27.0 |
| GLM-5.3 UD-Q4_K_XL | 467 | 434.9 |
| GLM-5.3 UD-IQ2_M | 239 | 222.6 |
Источники файлов: Qwen Q4_0 , Qwen Q8_0 , фрагменты GLM UD-Q4_K_XL и фрагменты GLM UD-IQ2_M . Значения округлены и проверены 6 октября 2026 года. Для GiB десятичные байты делятся на 2³⁰.
Это размеры файлов весов, а не общий объём резидентной памяти. Загрузка, кэши, временные буферы и компоненты модели меняют расход. Нельзя напрямую сопоставлять загрузку 29 GB с выделением 30 GiB.
Контекст меняет соответствие
Кэш внимания Qwen даёт рабочий пример. Опубликованная конфигурация указывает 64 слоя, полное внимание в каждом четвёртом слое, четыре KV-головы и размер головы 256.
Full-attention KV bytes per token:
16 layers × 4 KV heads × 256 dimensions × 2 (K and V) × 2 bytes
= 65,536 bytes
8,192 tokens = 0.5 GiB
32,768 tokens = 2.0 GiB
Этот расчётный компонент кэша предполагает 16-битные ключи и значения для одной последовательности. Он не включает состояние линейного внимания, буферы среды, накладные расходы аллокатора и дополнительные компоненты зрения или спекулятивного декодирования. Для них тоже нужна резерва.
Для иллюстративного бюджета добавьте 3–5 GiB к округлённым размерам весов. Это предположение нужно заменить измерениями выбранной среды.
| Сборка и контекст | Расчётный диапазон |
|---|---|
| Qwen Q4_0, 8K | 18.5–20.5 GiB |
| Qwen Q8_0, 8K | 30.5–32.5 GiB |
| Qwen Q8_0, 32K | 32.0–34.0 GiB |
Доступные 30 GiB оставляют место для Q4, а варианты Q8 превышают лимит при этих предположениях. Короткий успешный запрос не доказывает вместимость длинной сессии программирования.
Параллельные запросы добавляют ещё один фактор. Ollama описывает рост памяти при параллельных запросах и отдельные настройки точности кэша. Кэш Q8 использует примерно половину памяти кэша F16, Q4 примерно четверть, с компромиссами качества. См. FAQ Ollama .
Сопоставьте оборудование с объёмом
RTX 5090 имеет 32 GB выделенной графической памяти. DGX Spark со 128 GB использует общую память. Artificial Analysis описывает обе конфигурации. Большая ёмкость допускает большие размещения, но сама по себе не определяет скорость.
| Сценарий оборудования | Практический вывод |
|---|---|
| RTX 5090, 32 GB | Qwen Q4 оставляет больше места для контекста, чем Q8 |
| DGX Spark, 128 GB | Подходит любая сборка Qwen, но нужен запас для среды |
| Mac Studio, 256 GB | Большие веса возможны в зависимости от среды и лимитов |
GLM UD-Q4_K_XL превышает все три объёма ещё до добавления кэша. Набор IQ2 около 222,6 GiB также превышает систему 128 GB. На Mac 256 GB возможность зависит от памяти, доступной GPU, и остаточного запаса. Спецификации Apple показывают варианты оборудования, но не гарантируют объём для вывода.
Гипотетический бюджет 240 GiB оставляет около 17,4 GiB после весов IQ2. Бюджет 192 GiB не вмещает даже веса. Ни один бюджет не доказывает настройки ОС, поддержку сжатого кэша, полезную скорость или приемлемое качество IQ2. Перед покупкой требуйте проверенную конфигурацию среды.
Скорость является отдельным результатом
Локальный тест Artificial Analysis воспроизводит записанную нагрузку из 168 ходов модели. Результаты ноутбуков и рабочих станций показывают такие времена для Qwen3.8 27B.
| Система | Время воспроизведения обслуживания |
|---|---|
| DGX Spark, 128 GB | 24.2 минуты |
| RTX 5090 | 4.9 минуты |
| Mac Studio, 256 GB | В сравнении нет результата |
Результат RTX занимает примерно одну пятую времени Spark. Конфигурация обслуживания важна, поэтому это не универсальное соотношение. Тестовые сборки также отличаются от приведённых примеров GGUF.
Время воспроизведения не включает выполнение инструментов и задаёт записанную длину ответов. Оно не проверяет решение исходной задачи. Измерение MacBook также не доказывает производительность Mac Studio.
Давайте агенту обратную связь
Система выполнения агента предоставляет инструменты, контекст, цикл действий и проверку. Модель выбирает действия внутри системы. Для CSV-экспорта нужны чтение файлов, изменение кода, запуск тестов и обработка ошибок.
Рассмотрим иллюстративную задачу экспорта, а не измеренный эксперимент. Агент пишет загрузку, но использует неправильный формат даты. Визуальный просмотр не замечает проблему. Тест открывает файл, сравнивает даты с требуемым форматом, передаёт ошибку агенту, после чего агент меняет форматтер и повторяет проверку.
| Отсутствующий компонент | Вероятный сбой |
|---|---|
| Нужный контекст | Изменён не тот файл |
| Инструменты выполнения | Исправление описано, но не применено |
| Проверка | Работа остановлена после правдоподобного кода |
| Сообщение об ошибке | Повторен неудачный подход |
Отчёт LangChain сообщает изменение с 52,8% до 66,5% в Terminal Bench 2.0 при неизменном GPT-5.2-Codex. Отчёт по инженерии агентов описывает инструкции проверки, контекст среды, обнаружение повторных правок и изменения бюджета рассуждений.
Это данные от поставщика, а не доказательство равенства маленькой локальной модели передовой модели. Вывод уже: выбор модели сам по себе не объясняет результат агента. LangChain также сообщает о худших результатах при постоянном максимальном рассуждении из-за тайм-аутов.
Сопоставьте проверки с работой
Пройденная проверка подтверждает только покрываемую область. CSV-тест имён столбцов не проверяет даты, кавычки, Unicode или доступ. Сначала определите требуемый результат.
| Задача | Полезное доказательство завершения |
|---|---|
| Изменение кода | Нужные тесты и проверка итогового поведения |
| Исследовательский ответ | Источники для отдельных утверждений |
| Бронирование или возврат | Верное сохранённое состояние и соблюдение политики |
| Экспорт документа | Разобранный результат с нужными полями и форматами |
Исследование τ-bench оценивает агентов, работающих с инструментами, пользователями и правилами домена. Научная статья сравнивает итоговое состояние базы с ожидаемым. Гладкое подтверждение не является достаточной проверкой транзакции.
Локально не значит автономно
Локальный вывод определяет место работы модели. Окружающее приложение всё ещё определяет путь документов, поисковых запросов, трасс и результатов инструментов. Локальная модель кодирования со внешним поиском остаётся сетевой системой.
Ollama заявляет, что не получает запросы и ответы при локальном выполнении, и описывает отключение облачных функций. Это утверждение конкретной среды, а не гарантия приватности каждого подключённого агента. Проверяйте endpoint модели и каждую интеграцию по документации среды .
| Путь данных | Что проверить |
|---|---|
| Endpoint вывода | Локальный процесс, удалённый сервер или автоматический fallback |
| Поиск и получение | Внешняя отправка запросов и фрагментов документов |
| Подключения инструментов | Файлы и записи, доступные каждой службе |
| Логи и трассы | Место хранения, срок сохранения и доступ |
Гибридный процесс требует явного правила передачи. Например, извлекайте частные документы локально, затем отправляйте для анализа только одобренные агрегаты. Проверяйте отправляемый материал. Резюме остаётся чувствительным, если сохраняет имена, данные клиентов или конфиденциальные выводы.
Тестируйте до покупки
Выберите повторяемую задачу с ясным условием завершения. Сравните локальную систему с используемым размещённым продуктом и его инструментами. Дайте обеим системам одинаковые входные данные и критерии, затем повторите задачу на нескольких примерах.
- Запишите конфигурацию: точный файл модели, квантизацию, версию backend, предел контекста и настройку рассуждений.
- Определите успех: ожидаемый артефакт, требуемое поведение и запрещённые побочные эффекты.
- Измерьте выполнение: время, пройденные проверки, неудачные попытки и ручные исправления.
- Учтите стоимость владения: оборудование, электричество, API, обслуживание и своё время.
- Классифицируйте сбои: рассуждение, память, задержка, отсутствующий контекст или проверка.
Локальный вывод подходит, когда качество и задержка отвечают требованиям. Размещённая модель полезна, если дополнительные возможности сокращают ошибки или проверку. Гибридный процесс распределяет задачи после определения данных, которым разрешено покидать машину.
Считайте стоимость принятого результата
Время исправления человеком часто меняет экономику. Быстрый локальный ответ с десятью минутами исправлений требует больше рабочего времени, чем медленный ответ, прошедший проверку.
Cost per accepted task =
(hardware allocation + electricity + service fees + maintenance + review time)
÷ accepted tasks
Иллюстративная стоимость проверки: при 30 долларах в час восемь минут исправлений стоят 4 доллара на задачу. Сто задач требуют 400 долларов времени проверки. Это арифметические примеры, а не измеренная частота ошибок.
Сравнивайте равные результаты. Включайте отклонённые попытки во время и стоимость. Для собственного оборудования распределяйте покупную цену на реалистичный срок и объём задач. Для размещённой службы включайте подписку или API и оставшуюся проверку.
Подробнее об оборудовании читайте в руководстве по локальным моделям, GPU и контексту . О ёмкости и цене читайте в сравнении памяти DGX Spark . По результатам задач выберите наименьшую систему, отвечающую требованиям качества, скорости и данных.
Справочное видео
Источники
- AI Mechanics: Локальный ИИ и ChatGPT: насколько мы близки? .
- Artificial Analysis: результаты моделей , методика оценки и результаты локального вывода .
- Авторы моделей: Qwen3.8-27B и GLM-5.3 .
- Unsloth: сборки Qwen GGUF и сборки GLM GGUF .
- Ollama: документация среды, памяти и приватности .
- LangChain: результаты инженерии агентов .
- τ-bench: исследование оценки агентов .