Table of Contents

Локальный ИИ уменьшает границу данных. Промпт, обработанный локальным runtime, остается на устройстве, если модель, инструменты, логи и сетевой путь остаются локальными. Локальная GPU не превращает компьютер в изолированную систему.

Runtime моделей, плагины инструментов, расширения браузера, удаленный доступ, открытые API и загрузки моделей по-прежнему формируют риск. Важна и цена. Электричество может стоить меньше облачных токенов, а владение оборудованием отодвигает полный порог окупаемости далеко в будущее.

Сначала это руководство описывает границу приватности. Затем оно проверяет стоимость по текущим ценам поставщиков, явному допущению о мощности и показателям из предоставленного видео.

Это сравнение локальной и облачной стоимости дает контекст для формул ниже. Не копируйте показатели скорости без теста того же файла модели и runtime на своем оборудовании.

В видео указано время работы 2 минуты 31 секунда. Я проверил название и время по странице видео. Я не повторял тест оборудования, поэтому указанные скорости остаются измерениями из источника.

Короткий ответ

  • Выбирайте локальный вывод для контролируемого пути данных. Держите сервер модели на устройстве, привязывайте его к loopback и ограничивайте доступ инструментов.
  • Выбирайте облачный вывод для редкой работы. Не тратьте деньги на оборудование, если нагрузка мала или нужная модель не помещается в систему.
  • Считайте локальную стоимость двумя числами. Отделяйте электричество за активный час от владения оборудованием.
  • Считайте приватность свойством системы. Частная модель теряет пользу, когда плагин загружает файлы или локальный API слушает все сетевые интерфейсы.

Локальный вывод помогает, когда чувствительный текст должен оставаться внутри рабочей станции или изолированной сети. Он также полезен для автономной работы, фиксированной версии модели и предсказуемого доступа без квоты поставщика.

Эти преимущества не доказывают качество ответов. Облачная модель может лучше подходить задаче, быстрее завершать ее или требовать меньше обслуживания. Измерьте нагрузку до покупки оборудования.

Проследите путь данных

Составьте карту каждого компонента запроса. Одно имя модели не показывает, куда движутся данные.

Компонент Вопрос о приватности Какие доказательства собрать
Локальный сервер модели Остается ли промпт на хосте? Конфигурация процесса, адрес прослушивания и исходящий трафик
Облачная модель Какие тексты, файлы и результаты инструментов покидают хост? Endpoint API, условия поставщика, логи запросов и настройки аккаунта
Облачный режим локального приложения Запускается ли выбранная модель на устройстве? Идентификатор модели, метка поставщика и сетевое соединение
Плагин инструмента Получает ли модель файлы, вывод shell или содержимое браузера? Список инструментов, разрешения и перехваченные данные запросов
Загрузка модели Какой код и веса попадают на хост? Исходный репозиторий, лицензия, checksum релиза и путь загрузки
Локальные логи Где сохраняются промпты и результаты инструментов? Логи runtime, история shell, отчеты о сбоях и область резервного копирования

Локальная модель убирает одного поставщика из пути промпта. Необходимость проверять остальной путь сохраняется.

Локальный режим не означает приватность по умолчанию

Ollama’s privacy policy сообщает, что Ollama не видит промпты или данные при локальном запуске модели. Политика также разделяет локальную работу и облачные модели. Облачная модель все равно создает границу сервиса, даже если одно приложение запускает оба режима.

llama.cpp’s server documentation показывает, что локальный сервер по умолчанию слушает 127.0.0.1:8080. В примерах Docker также есть --host 0.0.0.0, который открывает сервис на всех интерфейсах. Более широкий адрес bind меняет границу доступа.

Проверьте адрес прослушивания до отправки чувствительного текста:

lsof -nP -iTCP -sTCP:LISTEN | rg 'ollama|llama|8080|11434'

127.0.0.1 или localhost обычно ограничивает доступ тем же хостом. Адрес LAN или 0.0.0.0 требует правила firewall и плана аутентификации. Не открывайте endpoint модели в сети до проверки обоих вариантов.

Проверьте и имя выбранной модели. Облачная документация Ollama описывает cloud-модели как отдельный путь сервиса. Локальный интерфейс не доказывает локальное выполнение.

FAQ Ollama описывает режим только локальной работы. Установите disable_ollama_cloud в ~/.ollama/server.json или задайте OLLAMA_NO_CLOUD=1 перед перезапуском службы. Это удаляет облачные модели Ollama и веб-поиск из выбранного runtime. Другие приложения, браузерные инструменты, плагины и сетевой доступ на хосте это не ограничивает.

{
  "disable_ollama_cloud": true
}

Проверьте настройку после перезапуска. Локальный runtime сужает один путь. Он не делает хост приватным.

Посчитайте облачную стоимость

Цены токенов разделяют вход и выход. Anthropic lists Claude Haiku 5.5 at $0.10 per million input tokens and $0.50 per million output tokens for prompts up to 100,000 tokens . Для промптов свыше 100 000 токенов действуют более высокие указанные тарифы.

OpenAI’s token guide объясняет, почему число слов не равно числу токенов. В ней также разделены входные, выходные, кэшированные входные токены и токены рассуждений. Используйте поля использования поставщика, а не оценку по числу слов.

Для простого сравнения возьмите миллион сгенерированных токенов и миллион входных токенов как отдельные нагрузки. Coding agent часто отправляет повторяющийся контекст и создает короткий ответ, поэтому одна объединенная цифра скрывает состав стоимости.

Рассчитайте локальную мощность

NVIDIA’s RTX 5070 launch announcement указала стартовую цену $549. NVIDIA’s RTX 5070 family page указывает 12 GB памяти и 250 W общей графической мощности для эталонного дизайна Founders Edition. На странице продукта NVIDIA по-прежнему указана цена $549, а во время проверки карта была недоступна.

Показатель мощности GPU не равен мощности всей системы. Используйте ваттметр для своего ПК. Рабочий пример ниже предполагает потребление всей системы 400 W, включая GPU, процессор, память, накопитель, вентиляторы и потери блока питания. Это допущение для арифметики, а не измеренный результат.

The U.S. Energy Information Administration forecast использовал 18,2 цента за киловатт-час как среднюю бытовую цену электричества в 2026 году. Ваша ставка меняет результат.

Используйте эту формулу для сгенерированного вывода:

local cost per 1M output tokens =
(whole_system_watts / 1,000)
× (1,000,000 / output_tokens_per_second / 3,600)
× electricity_price_per_kWh

При 400 W и $0.182 за киловатт-час система стоит $0.0728 за активный час.

Скорость вывода Время для 1M токенов Стоимость энергии для 1M токенов
20 tokens per second 13 часов 53 минуты $1.01
50 tokens per second 5 часов 33 минуты $0.40
94 tokens per second 2 часа 57 минут $0.22

При 50 выходных токенах в секунду локальная энергия стоит меньше, чем цена вывода Haiku 5.5 в $0.50. При 20 токенах в секунду локальная энергия стоит дороже. Порог скорости вывода при этих допущениях составляет около 40 токенов в секунду.

Для входа используется та же формула. При 2 650 входных токенах в секунду миллион входных токенов занимает около 6 минут 17 секунд и стоит около $0.008 энергии. При 1 000 входных токенах в секунду та же работа стоит около $0.020.

Предоставленная расшифровка сообщает о 94 выходных токенах в секунду и 2 650 входных токенах в секунду в примере с RTX 5070. Арифметика выше совпадает с этими цифрами при допущении 400 W. В расшифровке нет независимого лабораторного отчета, hash файла модели, сборки runtime, промпта или показания ваттметра. Считайте эти скорости справочным результатом, а не гарантией покупки.

Оборудование меняет окупаемость

Экономия энергии сама по себе не окупает оборудование. Сравните полную покупку с разницей между стоимостью облачного вывода и локальными переменными затратами.

При 50 выходных токенах в секунду:

$0.50 hosted output price - $0.40 local power = $0.10 saved per 1M tokens
$549 GPU price / $0.10 = about 5.5 billion output tokens

При 94 выходных токенах в секунду округленная экономия возрастает примерно до $0.28 на миллион токенов. Для возврата $549 за GPU потребуется около 2 миллиардов выходных токенов. Оба расчета исключают системную память, накопитель, материнскую плату, блок питания, охлаждение, обслуживание и остаточную стоимость.

Стартовая цена не является универсальным предложением. Текущая страница NVIDIA показывала официальную цену, но товара не было. Предложение продавца за $819 нужно отдельно проверить до добавления в модель окупаемости. Используйте реальный счет и измеренную мощность из розетки.

Наличие оборудования меняет решение. Если в рабочей станции уже достаточно памяти и установлен подходящий GPU, стоимость оборудования уже понесена для следующей задачи. Сравните мощность, время, качество, приватность и обслуживание. Если требуется купить полную систему, сравните всю систему с облачным использованием.

Сведения о соответствии моделей смотрите в local AI model and GPU context guide и 16GB VRAM sizing guide . О заявленной конфигурации локального coding agent читайте в Strata and OpenCode guide .

Что дает локальная приватность

  • Короткий путь данных: промпту не нужно достигать поставщика модели, если вывод остается локальным.
  • Работа без сети: загруженной модели и локальному runtime не нужно активное соединение с поставщиком для генерации текста.
  • Контроль версий: вы выбираете файл модели и версию runtime, а не получаете автоматическое изменение от поставщика.
  • Контроль использования: локальный вывод исключает облачный счетчик за запрос после учета владения оборудованием и энергии.
  • Контроль сетевой политики: firewall и средства контроля хоста определяют, кто достигает endpoint модели.

Эти преимущества особенно важны для исходного кода, записей клиентов, невыпущенных разработок, личных заметок и работы в отключенной среде. Локальному выводу по-прежнему нужны шифрование диска, обновления хоста, разделение аккаунтов и ограниченные инструменты.

Чего локальная приватность не дает

  • Гарантии качества: малые или квантованные модели нужно проверять по вашим реальным критериям приемки.
  • Гарантии цепочки поставок: файлы моделей, runtime, плагины и образы контейнеров требуют доверенных источников и проверок целостности.
  • Чистого хоста: вредоносное ПО, расширения браузера, резервные копии, отчеты о сбоях и удаленное администрирование по-прежнему видят данные хоста.
  • Безопасного сетевого endpoint: сервер, привязанный ко всем интерфейсам, создает новый сервис для защиты.
  • Бесплатной системы: электричество, хранилище, охлаждение, износ оборудования и обслуживание по-прежнему стоят денег.

Strata local coding-agent guide показывает, почему системная память, контекст, доступ инструментов и настройки runtime входят в оценку. Одна только память GPU не определяет границу приватности или производительности.

Выберите правильную границу

Ситуация Лучший первый выбор Причина
Чувствительные документы и совместимый имеющийся ПК Local inference Держите промпты на контролируемом хосте и избегайте новых расходов на оборудование
Редкая общая подготовка текста Hosted API или chat service Платите за небольшую нагрузку и избегайте обслуживания
Передовая модель или специализированный облачный инструмент Hosted service Нужная модель или инструмент недоступны на локальном хосте
Большой регулярный объем с проверенной локальной моделью Local или hybrid Сравните энергию, качество, время поддержки и цены поставщика
Смешанные нагрузки Hybrid routing Оставляйте чувствительные задачи локально и отправляйте разрешенные общие задачи в облачную модель

Для гибридной маршрутизации нужно явное правило классификации. Помечайте данные как только локальные, разрешенные для облачной обработки или запрещенные до проверки. Не полагайтесь на имя модели или значок приложения при применении правила.

Проверьте до доверия

  1. Назовите путь модели. Запишите идентификатор модели, runtime, версию и источник загрузки.
  2. Проверьте bind-адрес. Убедитесь, что сервер слушает loopback, если для более широкого пути нет документированной необходимости.
  3. Перечислите все инструменты. Проверьте доступ к файлам, shell, браузеру, сети и плагинам.
  4. Проверьте сохранение данных. Найдите логи промптов, вывод инструментов, отчеты о сбоях, резервные копии и общие каталоги моделей.
  5. Протестируйте сетевое поведение. Наблюдайте соединения во время чувствительного теста с репрезентативным промптом.
  6. Измерьте систему. Запишите мощность из розетки, скорость вывода, скорость входа, длину контекста и повторы.
  7. Проверьте принятую работу. Сравните завершенные задачи и усилия на проверку, а не только токены в секунду.

local AI versus ChatGPT guide рассматривает компромиссы возможностей моделей. Используйте этот чеклист приватности вместе с тестом качества.

Источники