VMTech
Обсудить проект

OpenAI раскрыла подход к более дешёвым агентам на GPT‑5.6

OpenAI раскрыла подход к более дешёвым агентам на GPT‑5.6

OpenAI опубликовала практическое руководство по внедрению семейства GPT‑5.6 в агентные системы. Компания утверждает, что модели Sol, Luna и Terra позволяют снижать стоимость и расход токенов без обязательной переработки базовой обвязки: на BrowseComp GPT‑5.6 Luna в режиме Extra High получила 84,04% при цене $1,33, тогда как GPT‑5.5 Extra High тремя месяцами ранее показала 84,36% за $33,27.

Модель предлагается выбирать по этапам работы

OpenAI рекомендует не использовать флагманскую модель на всём пути выполнения задачи. Luna и Terra компания называет подходящими для массовых операций, чувствительных к задержке взаимодействий и повторяющихся шагов в агентных сценариях. В качестве примера приводится обработка рукописных юридических записок перед последующим агентным анализом.

В производственных тестах партнёры OpenAI приводят собственные результаты. Hypha заявила, что Luna сохраняет 98% точности извлечения GPT‑5.5 при одной восемнадцатой стоимости. PlayerZero сообщила о снижении расходов на инференс на 64%, сокращении времени ответа на 90% и росте F1 на пять пунктов для одной задачи исследования кода.

Экономика семейства меняется и за счёт цен: в контексте этого позиционирования важны удешевление GPT‑5.6 Luna и Terra, где OpenAI сообщала об удешевлении Luna и Terra и запуске Fast mode для Sol.

Responses API получил новые механизмы для агентов

Одновременно OpenAI развивает Responses API. Сохранение рассуждений между ходами и нативный compaction предназначены для того, чтобы агент сохранял связность работы на длинных задачах и не восстанавливал прежний контекст заново. На ARC-AGI-3 GPT‑5.6 Sol со стандартной обвязкой набрала 13,3%, а после включения сохранения рассуждений и сжатия — 38,3% при примерно шестикратно меньшем числе выходных токенов.

Функция Programmatic Tool Calling позволяет модели писать JavaScript для координации инструментов, параллельного запуска независимых вызовов и обработки результатов вне контекстного окна. По замыслу OpenAI, это переносит фильтрацию, агрегацию и другие детерминированные операции в код, оставляя модели задачи, где требуется суждение.

Для параллелизуемых задач API поддерживает нативную многоагентную схему: главный агент распределяет работу между подагентами и собирает итоговый ответ. Кроме того, минимальное время жизни prompt-кэша во всём семействе увеличено до 30 минут, а точки кэширования можно задавать детерминированно внутри контекстного окна.

Что проверить командам

Практический вывод для бизнеса — измерять стоимость и качество не только по одной модели, а по всей цепочке агентного процесса. Повторяющиеся операции можно вынести на Luna или Terra, обработку данных — в программные вызовы инструментов, а Sol оставить для синтеза и задач, требующих оценки. Эффект такого разделения зависит от конкретной обвязки, поэтому его необходимо проверять на собственных сценариях и метриках.

#openai#gptmodels#aiagents#responsesapi
Открытая аналитика
На сайте 0 просмотров
мин чтения 3 13.08.2026
Instagram

OpenAI раскрыла подход к более дешёвым агентам на GPT‑5.6

Открыть публикацию в Instagram ↗