VMTech
Обсудить проект

OpenAI пересмотрела оценку SWE-Bench Pro: около 30% задач оказались сломаны

OpenAI пересмотрела оценку SWE-Bench Pro: около 30% задач оказались сломаны

Друзья, хочу поделиться важной новостью из экосистемы OpenAI.

Я обратил внимание на аудит SWE-Bench Pro: команда выявила, что примерно 30% задач в бенчмарке некорректны.

Среди основных проблем:
— слишком строгие тесты;
— недостаточно конкретные промпты;
— низкое покрытие тестами;
— вводящие в заблуждение формулировки.

OpenAI также отозвала прежнюю рекомендацию переходить на SWE-Bench Pro.

Почему это важно: качество бенчмарков напрямую влияет на то, как мы оцениваем модели, делаем выводы о возможностях ИИ и принимаем решения о внедрении.

А как Вы проверяете, что оценка модели действительно отражает реальную способность, а не ошибки датасета?

#OpenAI #ИИ #бенчмарки #MachineLearning

Открытая аналитика
На сайте 2 просмотров
мин чтения 1 08.07.2026
В Instagram 3 просмотров
В Instagram 1 охват
Instagram

OpenAI пересмотрела оценку SWE-Bench Pro: около 30% задач оказались сломаны

Открыть публикацию в Instagram ↗