OpenAI раскрыла подход к более дешёвым агентам на GPT‑5.6

OpenAI опубликовала практическое руководство по внедрению семейства GPT‑5.6 в агентные системы. Компания утверждает, что модели Sol, Luna и Terra позволяют снижать стоимость и расход токенов без обязательной переработки базовой обвязки: на BrowseComp GPT‑5.6 Luna в режиме Extra High получила 84,04% при цене $1,33, тогда как GPT‑5.5 Extra High тремя месяцами ранее показала 84,36% за $33,27.
Модель предлагается выбирать по этапам работы
OpenAI рекомендует не использовать флагманскую модель на всём пути выполнения задачи. Luna и Terra компания называет подходящими для массовых операций, чувствительных к задержке взаимодействий и повторяющихся шагов в агентных сценариях. В качестве примера приводится обработка рукописных юридических записок перед последующим агентным анализом.
В производственных тестах партнёры OpenAI приводят собственные результаты. Hypha заявила, что Luna сохраняет 98% точности извлечения GPT‑5.5 при одной восемнадцатой стоимости. PlayerZero сообщила о снижении расходов на инференс на 64%, сокращении времени ответа на 90% и росте F1 на пять пунктов для одной задачи исследования кода.
Экономика семейства меняется и за счёт цен: в контексте этого позиционирования важны удешевление GPT‑5.6 Luna и Terra, где OpenAI сообщала об удешевлении Luna и Terra и запуске Fast mode для Sol.
Responses API получил новые механизмы для агентов
Одновременно OpenAI развивает Responses API. Сохранение рассуждений между ходами и нативный compaction предназначены для того, чтобы агент сохранял связность работы на длинных задачах и не восстанавливал прежний контекст заново. На ARC-AGI-3 GPT‑5.6 Sol со стандартной обвязкой набрала 13,3%, а после включения сохранения рассуждений и сжатия — 38,3% при примерно шестикратно меньшем числе выходных токенов.
Функция Programmatic Tool Calling позволяет модели писать JavaScript для координации инструментов, параллельного запуска независимых вызовов и обработки результатов вне контекстного окна. По замыслу OpenAI, это переносит фильтрацию, агрегацию и другие детерминированные операции в код, оставляя модели задачи, где требуется суждение.
Для параллелизуемых задач API поддерживает нативную многоагентную схему: главный агент распределяет работу между подагентами и собирает итоговый ответ. Кроме того, минимальное время жизни prompt-кэша во всём семействе увеличено до 30 минут, а точки кэширования можно задавать детерминированно внутри контекстного окна.
Что проверить командам
Практический вывод для бизнеса — измерять стоимость и качество не только по одной модели, а по всей цепочке агентного процесса. Повторяющиеся операции можно вынести на Luna или Terra, обработку данных — в программные вызовы инструментов, а Sol оставить для синтеза и задач, требующих оценки. Эффект такого разделения зависит от конкретной обвязки, поэтому его необходимо проверять на собственных сценариях и метриках.

