VMTech
Обсудить проект

Vals привлекла $40 млн на оценку AI-моделей в реальных отраслях

Vals привлекла $40 млн на оценку AI-моделей в реальных отраслях

Американский стартап Vals, основанный в 2024 году, привлёк $40 млн в раунде Series A, который возглавила Andreessen Horowitz. Компания разрабатывает систему оценки AI-моделей для задач права, финансов и программирования, а также проверяет возможные негативные последствия их работы. До этого Vals получила посевные инвестиции от 8VC и Bloomberg Beta.

Закрытые задания вместо академических тестов

Сооснователь Vals Раян Кришнан считает, что традиционные академические бенчмарки не успевают за быстро меняющимися моделями. Такие тесты часто измеряют абстрактные знания: например, способность ответить на вопросы, похожие на экзаменационные. При этом они не всегда показывают, способна ли система выполнить полезную рабочую задачу.

Vals строит проверки вокруг конкретных отраслевых сценариев. Компания оценивает, может ли модель создать результат того же качества, что и человек, в определённой профессиональной области. В фокусе находятся не только успешные ответы, но и отрицательные эффекты, которые могут возникнуть при использовании модели.

Материалы испытаний Vals не публикует. По замыслу стартапа, это снижает риск, что создатели моделей будут специально обучать их на известных заданиях и получать улучшенный результат лишь в конкретном тесте. Компании платят Vals за оценку своих систем, чтобы выявлять слабые места и отслеживать улучшения.

Новые направления и рост команды

Помимо права, финансов и разработки, Vals создаёт бенчмарки для рекурсивного самоулучшения, психического здоровья, кибербезопасности, биобезопасности и международного гуманитарного права. В последнем случае компания изучает, как модели применяют положения Женевских конвенций.

Vals сообщила, что её выручка сейчас в восемь раз выше прошлогодней. С начала года команда выросла с восьми до 25 сотрудников; в дальнейшем стартап намерен нанять ещё от 10 до 15 человек и переехать в более крупный офис. Компания также запустила программу оценки моделей для федеральных ведомств США.

Что это меняет для заказчиков AI

По мере внедрения генеративных систем покупателям недостаточно общих заявлений о возможностях модели или её места в публичном рейтинге. Практический критерий — проверка на задачах, близких к собственным процессам, с анализом ошибок и нежелательных результатов. Такой подход помогает сопоставлять модели по условиям, важным для конкретного применения, и использовать результаты тестирования при выборе поставщика.

#aibenchmarking#aimodels#aievals#aigovernance
Открытая аналитика
На сайте 0 просмотров
мин чтения 3 19.09.2026
Instagram

Vals привлекла $40 млн на оценку AI-моделей в реальных отраслях

Открыть публикацию в Instagram ↗