Сохранение рассуждений и compaction повысили результат GPT-5.6 Sol на ARC-AGI-3 втрое

29 июля 2026 года OpenAI сообщила, что две настройки Responses API утроили результат GPT‑5.6 Sol на публичном наборе ARC-AGI-3: показатель RHAE вырос с 13,3% до 38,3%, а расход выходных токенов сократился в шесть раз.
Почему модель выглядела слабее своих возможностей
ARC-AGI-3 проверяет, как агент осваивает незнакомые двумерные игры без инструкций. Модель получает текстовое представление каждого кадра и должна самостоятельно понять правила. Средний результат человека OpenAI оценила в 48%.
Изначально GPT‑5.6 Sol набрала на бенчмарке 7,8%, а GPT‑5.5 — 0,4%. Причина оказалась не только в моделях: официальный универсальный harness не учитывал особенности их работы с контекстом.
Что изменили в тестовой обвязке
После каждого действия harness удалял приватные рассуждения. Модель видела прежние ходы и короткие заметки, но теряла планы и выводы, поэтому фактически заново интерпретировала игру на каждом шаге.
Кроме того, при превышении 175 000 символов применялось скользящее усечение: старые действия исчезали из контекста. Это мешало агенту сохранять знания, накопленные в длинных игровых сессиях.
OpenAI перенесла тест на Responses API. Передача идентификатора предыдущего ответа сохранила рассуждения между действиями, а compaction заменила удаление истории её сжатием. В реализации компании использовался предел 175 000 токенов; для игровых сеток он близок к исходному лимиту из-за токенизации примерно один к одному.
Результат и рекомендации
С памятью о прошлых выводах GPT‑5.6 Sol тратила меньше времени на обдумывание каждого хода и последовательнее применяла найденные стратегии. В показанной OpenAI игре новая обвязка позволила модели пройти все шесть уровней, тогда как в официальном рейтинге передовые модели не проходили дальше первого.
- использовать Responses API вместо Chat Completions API;
- сохранять рассуждения между вызовами инструментов;
- применять compaction при росте контекста.
Результаты согласуются с выводами о росте эффективности GPT-5.6 при снижении расхода токенов: архитектура запуска может влиять на качество и стоимость не меньше, чем выбор версии модели.
Для бизнеса это означает, что агентные решения нельзя оценивать по результатам модели в отрыве от памяти, контекста и управляющей обвязки. Перед внедрением стоит воспроизводить рабочую конфигурацию, проверять длинные сценарии и одновременно измерять точность, скорость и расход токенов.

