OpenAI пересмотрела оценку SWE-Bench Pro: около 30% задач оказались сломаны

Друзья, хочу поделиться важной новостью из экосистемы OpenAI.
Я обратил внимание на аудит SWE-Bench Pro: команда выявила, что примерно 30% задач в бенчмарке некорректны.
Среди основных проблем:
— слишком строгие тесты;
— недостаточно конкретные промпты;
— низкое покрытие тестами;
— вводящие в заблуждение формулировки.
OpenAI также отозвала прежнюю рекомендацию переходить на SWE-Bench Pro.
Почему это важно: качество бенчмарков напрямую влияет на то, как мы оцениваем модели, делаем выводы о возможностях ИИ и принимаем решения о внедрении.
А как Вы проверяете, что оценка модели действительно отражает реальную способность, а не ошибки датасета?
#OpenAI #ИИ #бенчмарки #MachineLearning

