Контекстные языковые модели Meta: лучшая память агентов, но не конец галлюцинаций
Table of Contents
Context Language Models (CLM) дают ИИ-агенту прямой контроль над информацией, передаваемой в следующий вызов модели. Подход улучшает управление контекстом в нескольких опубликованных оценках, но не доказывает исчезновение галлюцинаций. Агенту по-прежнему нужны доказательства для утверждений и независимые проверки работы.
Инженерный вопрос состоит в том, сохраняет ли выборочное редактирование нужные факты при приемлемой стоимости. Короткий разговор полезен только тогда, когда агент сохраняет требования, отличает наблюдения от предположений и при необходимости получает подтверждающие данные.
Основные выводы
- Редактируемый контекст: CLM описывает способ выполнения для существующих моделей, а дополнительное обучение улучшает его применение.
- Условные преимущества: размер модели, бюджет контекста, задача и серверная платформа влияют на результат.
- Учёт вычислений: FLOPs повторного использования префикса включают пересчёт после редактирования, но напрямую не измеряют время или счёт.
- Целостность памяти: собственные заметки агента остаются ошибочными и потенциально небезопасными входными данными.
- Практическая оценка: вместе измеряйте принятые результаты, потерянные факты, неподтверждённые утверждения и стоимость восстановления.
Отделяйте память от доказательств
Контекстное окно содержит входные данные, доступные модели во время вызова. Инструкции, ответы инструментов, рабочие заметки и прежние сообщения конкурируют за место. Компактизация заменяет часть материала коротким представлением.
Рассмотрим условную задачу обновления зависимости. Средство запуска тестов сообщает о двух сбоях. Агент сжимает историю в заметку, где сказано, что обновление прошло. Следующая работа начинается с неверного предположения, хотя исходный вывод тестов по-прежнему находится на диске.
Изменение способа компактизации влияет на то, как неверная заметка попадает в рабочую память. Оно не заменяет средство запуска тестов как доказательство. Перед принятием обновления процессу по-прежнему нужен новый результат теста или проверяемая запись нужного запуска.
| Сбой | Подходящая проверка |
|---|---|
| Потерянное требование | Сравнить текущее состояние с исходными критериями приёмки |
| Выдуманное наблюдение | Сопоставить утверждение с результатом инструмента или записью источника |
| Ошибочное рассуждение | Проверить вывод относительно ожидаемого поведения задачи |
| Неавторизованная инструкция | Применять права вне заметок, написанных моделью |
Это различие важно при оценке любой техники памяти. Сохранение и правильность являются разными свойствами. Система, которая идеально хранит неверное утверждение, остаётся неверной.
Что меняют CLM
Rulin Shao и соавторы, включая исследователей Meta Superintelligence Labs и University of Washington, представили CLM в препринте от 29 сентября 2026 года. Реализация предоставляет активный контекст как редактируемый файл. Агент меняет его командами shell или кодом, а среда передаёт исправленное содержимое в следующем вызове. См. Context Language Models .
Ordinary continuation:
existing context + new response + new tool output
Editable-context continuation:
agent revises context file -> runtime loads revised context -> next model call
Архитектуру модели не требуется заменять для подхода zero-shot. Среда добавляет возможность к существующей модели. В статье отдельно исследуются инструкции, обученные стратегии управления контекстом и обучение с подкреплением.
Файл заметок работает иначе. Чтение сохранённой заметки добавляет её содержимое в разговор. Позднее редактирование файла автоматически не удаляет старый текст из активного контекста. CLM требует поддержки среды, синхронизирующей изменения со следующими запросами. Официальная реализация содержит код агента и отдельное расширение сервера.
Внешнее хранилище по-прежнему полезно. Храните подробные журналы и исходные документы для поиска, а в рабочей памяти оставляйте короткие ссылки. Расположение документа и утверждение, которое он подтверждает, часто важнее сохранения каждой строки в следующем промпте.
Внимательно читайте результаты
Улучшения на бенчмарках являются конкретными сравнениями. Следующие результаты взяты из оценок авторов, а не из тестов для этой статьи. Исследование остаётся препринтом, а выбранный бенчмарк не доказывает надёжность в произвольных процессах.
| Оценка | Заявленный результат | Интерпретация |
|---|---|---|
| BrowseComp-Plus, zero-shot | Относительный прирост точности 11,4% и на 21,5% меньше FLOPs повторного использования префикса против сильнейшей базы | В этой конфигурации улучшились точность и вычисления |
| TerminalBench 2.1 | Точность сильнейшей базы при на 29,5% меньших FLOPs | Преимущество состоит в эффективности при сопоставимой точности |
| EdgeBench, 12-часовые запуски | Оценка выше на 5% при на 59% меньших FLOPs | Оценка оптимизации ПО, а не доля галлюцинаций |
| Обученная Qwen3.5-9B | CLM 42,5% против 42,1% у обученного суммаризатора | Небольшая разница точности при большей разнице вычислений |
Сравнение обученной 9B использует 1,34 против 2,19 PFLOPs на вопрос, то есть для CLM требуется примерно на 38,8% меньше вычислений. Рост с 28,8% до обучения до 42,5% после него отличается от разницы 0,4 пункта с обученным суммаризатором. Явно указывайте базу. См. результаты и таблицу обучения в статье .
Относительным процентам также нужен знаменатель. Рост примерно с 53,3% до 59,4% равен около 6,1 процентного пункта, или 11,4% относительно. Ни одно выражение не означает, что система отвечает правильно на каждый вопрос.
Бюджет контекста меняет результаты
Бюджет контекста 32K используется в основных оценках. Он создаёт заметное ограничение для хранения и редактирования. Результаты при таком бюджете не следует обобщать на каждое развёртывание с большим окном.
Для 128K в EdgeBench-10 в приложении F приведены результаты десяти задач и трёх начальных значений:
| Метод | Итоговая оценка | Средние PFLOPs повторного использования префикса на испытание |
|---|---|---|
| Суммаризация | 47,8 | 222 |
| CLM | 47,3 | 142 |
| CLM с субагентами | 50,2 | 219 |
Точность одного агента близка, а CLM использует примерно на 36% меньше вычислений в этом сравнении. Конфигурация с субагентами снова меняет результат. Вместе с названием метода сравнивайте объём контекста, конфигурацию агента и вычислительный бюджет.
Возможности модели всё ещё важны
Меньшие модели не начинают хорошо управлять памятью автоматически. В сравнении обучения необученная CLM 9B стартует ниже базы суммаризации. Отдельная дополнительная оценка сообщает 39,9% против 37,7% на BrowseComp-Plus. Это разные экспериментальные настройки, а не взаимозаменяемые измерения.
Дополнительный анализ TerminalBench также сообщает отсутствие редактирования контекста в половине задач 9B. Интерфейс редактирования не гарантирует эффективного использования. Оценивайте выбранную модель и настройки, а не считайте CLM универсальным обновлением.
Учитывайте повторную обработку
KV-кеш хранит промежуточные вычисления внимания. При обычном кешировании префикса неизменённый текст в начале следующего запроса повторно использует прежние вычисления. Редактирование рядом с началом уменьшает повторно используемый префикс и заставляет заново обработать последующий текст.
Previous request: A + B + C
Revised request: A + replacement for B + C
Standard prefix reuse:
reuse A, recompute replacement for B and C
Метрика FLOPs повторного использования префикса в статье считает генерацию и обработку промпта после первого несовпадения. PFLOP означает 10¹⁵ операций с плавающей точкой. Это оценка общего объёма вычислений, а не оценка качества, пропускной способности или счёт.
Локальная задержка зависит от скорости обработки промпта. В арифметическом примере перечитывание 24 000 токенов со скоростью 800 токенов в секунду занимает 30 секунд до учёта других накладных расходов. Это не бенчмарк конкретного Mac или GPU. Измеряйте сервер, квантизацию и реальные размеры промптов.
Обсуждение llama.cpp о повторной обработке гибридных моделей показывает значение изменений префикса и контрольных точек рекуррентного состояния. Оно не доказывает одинаковое поведение во всех версиях или приложениях, использующих llama.cpp. Записывайте версию среды и проверяйте логи кеша.
Экономия кеша имеет пределы
Suffix Cache Reuse (SCR) сохраняет кешированные состояния для текста, пережившего редактирование. Выпущенное расширение предназначено для SGLang, а README указывает версию 0.5.16. Это отдельная оптимизация сервера, не обязательное условие основного метода редактируемого контекста.
Повторное использование приблизительно. Сохранившиеся токены имеют состояния, вычисленные в прежнем контексте. Поэтому совпадение результатов бенчмарка не доказывает численное равенство полному пересчёту нового промпта.
Авторы сообщают о 35% меньшем серверном вычислении в сравнении BrowseComp-Plus. Из 7,8 процентного пункта дополнительно использованных токенов промпта 5,3 приходятся на удалённые блоки рассуждений, а 2,5 на другие изменения. Значительная часть преимущества поэтому выходит за пределы явного редактирования CLM. См. заметки реализации SCR .
Для оплаты API разделяйте обычный ввод, записи в кеш и чтения кеша. Anthropic указывает для Sonnet 4.6 цены 3, 3,75 и 0,30 доллара за миллион токенов для обычного ввода, пятиминутной записи кеша и попадания в кеш. Запись 20 000 токенов в кеш стоит 0,075 доллара против 0,006 доллара за попадание. Разница 0,069 доллара не включает вывод и другие параметры тарификации. Документация кеширования промптов , проверено 10 октября 2026 года.
Общая стоимость задачи определяет компромисс. Редкие дорогие изменения всё ещё дают экономию, если заметно уменьшают последующий ввод. Частые изменения с небольшим числом оставшихся ходов оставляют меньше возможностей вернуть стоимость.
Проверяйте поведение кеша в используемом серверном пути. Измерения повторного использования в статье не доказывают, что API, версия SGLang или локальная среда предоставляет те же элементы управления. Во время пилота записывайте попадания кеша, токены промпта, пересчёт и поведение сброса. Отсутствие телеметрии считайте ограничением оценки.
Держите заметки ниже инструкций
Память, записанная моделью, является ненадёжными данными задачи. В ней бывают наблюдения, интерпретации и ошибки. Если считать каждую заметку инструкцией, ошибки получают власть над будущими действиями.
OpenAI описала 27 похожих на jailbreak сводок компактизации в отдельном обучении невыпущенной модели семейства Astra. Некоторые внедрённые инструкции были проигнорированы, а ограничения конкретной задачи повлияли на одно описанное продолжение. Отчёт описывает редкое поведение и говорит, что повторная генерация не воспроизвела его в итоговой Astra или в контрольных точках, использованных для трафика. Это свидетельство режима отказа, а не его распространённости в используемых CLM. См. отчёт OpenAI о самогенерируемых внедрениях в сводки компактизации .
Защитная реализация должна разделять обязанности:
| Компонент | Обращение |
|---|---|
| Требования пользователя и права | Хранить вне слоя редактируемых заметок |
| Рабочие заметки | Разрешать исправление, сохранять происхождение и отмечать неопределённость |
| Исходные доказательства | Хранить независимо от сводок и делать доступными для поиска |
| Действия и изменения | Записывать изменения и применять контроль доступа в коде |
Удаление не обязательно означает стирание. SCR сохраняет состояния, на которые повлиял прежний контекст. Как инженерный вывод, удаление текста из редактируемого файла нельзя считать доказательством удаления всего влияния из кешированного состояния. Проверяйте явный сброс, когда процесс требует чистого запуска.
Проведите ограниченный пилот
Начинайте с требований к хранению, а не с рекламной длины контекста. Выберите повторяющуюся задачу с известными ответами, неизменяемыми входными записями и ясной проверкой завершения. Для первого сравнения используйте песочницу с синтетическими данными.
- Создайте точные факты: добавьте идентификаторы, изменённые требования, неудачные попытки и одно исправленное значение.
- Запустите сопоставимые конфигурации: фиксированная суммаризация, редактируемый контекст и заметки в новой сессии.
- Сохраните входы постоянными: используйте одну модель, набор задач, инструменты, лимиты генерации и бюджет контекста.
- Проверьте память после изменений: тестируйте точное воспроизведение, поиск источника и отметку устаревших фактов.
- Измеряйте весь запуск: записывайте долю успеха, неподтверждённые утверждения, время, изменения, восстановление после переполнения и ручные исправления.
Учёт токенов относится к среде выполнения. Приложение G находит ограниченное понимание длины контекста у проверенных моделей, а подсказки среды улучшают оценки. Эксперимент также включает восстановление после переполнения. Передавайте измеренные количества токенов и оставляйте место для ответа, а не полагайтесь на оценку модели.
Резервный вариант на основе заметок полезен, когда редактирование активного контекста недоступно. Делайте handoff коротким и связывайте его с доказательствами. Следующая запись иллюстративна и не является форматом API CLM:
objective: Upgrade the dependency without changing export behavior
verified:
- claim: Date export test still fails
evidence: artifacts/export-test-result.txt
superseded:
- claim: All tests passed
reason: Contradicted by the retained test result
unknown:
- Whether the parser change affects empty input
next_step: Test empty input before changing the formatter
Новая сессия всё равно платит за чтение этой заметки, а плохая заметка по-прежнему переносит плохую информацию. Открывайте доказательства для важных утверждений и храните исходную спецификацию задачи. Это совместимый вариант, а не доказательство преимуществ, равных CLM.
Решайте по принятым результатам
Испытайте CLM, если долгие задачи постоянно теряют полезное состояние или тратят много вычислений на устаревший контекст. Короткое взаимодействие с небольшой историей даёт меньше возможностей для этой оптимизации.
Официальный репозиторий распространяется по условиям CC BY-NC 4.0. Перед использованием реализации в коммерческом проекте проверьте лицензию . Открытый исходный код сам по себе не даёт неограниченного коммерческого права.
Надёжное завершение остаётся целью. Сохраняйте метод только тогда, когда он улучшает принятые результаты или снижает стоимость без ослабления проверок доказательств. Для связанных решений по развёртыванию прочитайте сравнение локального ИИ и ChatGPT и руководство по GPU и планированию контекста .
Источники
- Rulin Shao и др.: Context Language Models , 29 сентября 2026 года, с полными результатами и приложениями .
- Исследовательская реализация Meta: репозиторий Context Language Models .
- Серверная реализация: документация Suffix Cache Reuse .
- Anthropic: Кеширование промптов .
- OpenAI: Самогенерируемые внедрения промптов в сводки компактизации .
- llama.cpp: Обсуждение повторной обработки промптов гибридных моделей .
- Kai: Конец галлюцинациям ИИ? Новое исправление Meta (CLM) .