Cognition подключила GPT-6 Astra к самотестированию Devin

Cognition внедряет GPT-6 Astra в линейку Devin, чтобы автономный инженер тестировал внесённые изменения и показывал результат работы. Компания использует модель в облачном агенте Devin, а также в CLI- и настольных продуктах; в примере с игрой Otter Run агент вернул запись запуска приложения в симуляторе iPhone и отчёт о проверках.
Тестирование с подтверждением результата
Cognition называет Devin автономным программным инженером, которым пользуются компании от крупных банков до технологических стартапов. По мере роста объёма разработки проверка изменений становится для инженерных команд отдельной задачей.
Сооснователь Cognition Уолден Ян отметил, что GPT-6 Astra улучшает способность системы тестировать собственную работу и доказывать её работоспособность. В случае Otter Run видеозапись показывает поведение приложения, а отчёт фиксирует, какие проверки прошли и какие области остались непроверенными.
Такие материалы позволяют инженерам увидеть работу программы и понять, что ещё требует внимания. Речь не идёт о замене проверки одним роликом: отчёт отдельно обозначает границы проведённого тестирования.
Работа с сообщениями об ошибках
Модель используют и при обработке обращений клиентов. Если заказчик отправляет скриншот с ошибкой, команда может передать его Devin с GPT-6 Astra; агент исправляет проблему и возвращает скриншот результата. По словам Яна, это помогает Cognition отвечать клиентам быстрее.
Развитие продукта происходит на фоне того, что раунд Cognition с оценкой от 40 млрд долларов отражает интерес рынка к платформам AI-кодинга и их дальнейшему масштабированию. В Cognition рассчитывают, что более сильное тестирование позволит инженерам вручную просматривать меньше кода и при этом выпускать больше изменений.
Что это меняет для команд разработки
Подход Cognition строится на том, чтобы вместе с изменением кода предоставлять наблюдаемые результаты тестов: запись исполнения, список пройденных проверок и обозначение непокрытых сценариев. Это даёт ревьюеру дополнительный материал для оценки изменения.
Для бизнеса практический вывод состоит в том, что агентные инструменты стоит оценивать не только по способности писать исправления, но и по качеству доказательств их работы. В процессе внедрения важно сохранять проверку инженером и учитывать сценарии, которые автоматическое тестирование не охватило.

