VMTech
+381 11 4183 54024/7 Обсудить проект

Fish Audio получила $50 млн на развитие голосовой AI-платформы с 8 млн пользователей

Fish Audio получила $50 млн на развитие голосовой AI-платформы с 8 млн пользователей

Fish Audio привлекла $50 млн в посевном раунде под руководством Coreline Ventures и Capital Today. Платформой пользуются более 8 млн человек, а её регулярная годовая выручка достигла $21 млн. В раунде также участвовали 359 Capital, Parable, Play Time, Alphalist Partners и другие фонды.

Почему рынку нужны управляемые голоса

Создателям контента и игровым студиям важны эмоциональность и выразительность синтетической речи. Корпоративным клиентам, автоматизирующим поддержку и продажи, необходимы реалистичность, низкая задержка и точное управление результатом.

Fish Audio предлагает библиотеку из более чем 15 000 средств управления речью на естественном языке. Компанию основал бывший исследователь NVIDIA Shijia Liao, который обучил первую модель на одном GPU и открыл её код. Репозиторий Fish Speech получил свыше 31 000 отметок GitHub Stars.

Модели, монетизация и права авторов

За последний год стартап выпустил четыре модели генерации речи и одну модель распознавания. Три генеративные модели доступны с открытым кодом, но S2.1 Pro работает только через платный API. Клиентам предлагаются подписки с лимитами минут, клонированием голоса и корпоративная версия платформы. Среди пользователей названы HeyGen, Sanas и Plaud.

Часть голосовой библиотеки создаётся из записей пользователей, которым выплачивается вознаграждение за использование. Однако некоторые авторы заявляли, что их голоса загрузили без согласия. Генеральный директор Rissa Cao сообщила, что удаление автоматизировано: достаточно предоставить короткий образец или договор, после чего запись снимается с платформы менее чем за три минуты. При этом несанкционированная копия может использоваться до обращения правообладателя.

«Согласие, прозрачность и указание авторства должны быть встроены в продукт. Отрасли нужны проверка владения голосом, ясные лицензии, простое удаление и модели распределения дохода», — отметил партнёр Coreline Ventures Oskue Honda.

Практический вывод для бизнеса

Fish Audio планирует выпустить модель понимания аудио и разрабатывает speech-to-speech-систему. Компаниям, внедряющим voice AI, стоит оценивать не только качество и задержку моделей, но и происхождение датасетов, условия лицензирования, процедуру отзыва согласия и риски коммерческого использования чужого голоса.

#voiceai#ai#opensource#business

Голосовой AI для бизнеса: от модели к рабочему сценарию

Развитие Fish Audio показывает, что качество синтетической речи — только часть задачи. Голосовой ассистент для компании также требует понятного сценария, границ автоматизации, проверки на языке клиентов и прозрачных правил использования голосов.

Голосовая модель и бизнес-ассистент — не одно и то же

Модель отвечает за распознавание или генерацию речи. В бизнес-сценарии дополнительно нужно определить, какие обращения обрабатываются, когда разговор передаётся сотруднику и куда поступает его результат.

  • Начните с ограниченного набора повторяющихся обращений.
  • Заранее определите ситуации, требующие участия сотрудника.
  • Проверяйте речь на языках клиентов, включая сербский.
  • Опишите, какие итоги разговора нужны сотрудникам и системам.

Что оценивать при выборе голосовой технологии

Одной естественности голоса недостаточно. Для рабочего сценария важны задержка ответа, точность понимания, управляемость результата, условия коммерческого использования и процедура отзыва согласия на голос.

  • Сравнивайте качество на реальных фразах клиентов.
  • Проверяйте произношение имён, адресов, чисел и терминов.
  • Уточняйте происхождение голосов и условия лицензирования.
  • Проверяйте порядок удаления голоса после отзыва согласия.

Как провести содержательный пилот

Пилот лучше строить вокруг одного понятного процесса и проверять его на типичных и нестандартных диалогах. Для компаний в Сербии особенно важны сербское произношение и корректная обработка локальных имён и адресов.

  • Выберите сценарий с понятным началом и результатом.
  • Проверьте работу при шуме, паузах и перебиваниях.
  • Добавьте безопасный выход за пределами заданного сценария.
  • Фиксируйте ошибки понимания и уточняйте правила диалога.

Частые вопросы

Что означает голосовой AI для бизнеса?

Это применение распознавания и генерации речи в конкретном процессе компании: например, для обработки повторяющихся обращений. Ценность определяется не только голосом, но и логикой сценария.

Чем голосовая модель отличается от голосового ассистента?

Модель распознаёт или создаёт речь. Ассистент использует её внутри заданного диалога, следует бизнес-правилам и формирует результат для дальнейшей обработки.

Что проверить в голосовом ассистенте для сербского рынка?

Следует протестировать сербское произношение, локальные имена, адреса, числа, отраслевые термины, паузы и перебивания на реальных примерах обращений.

Можно ли начинать автоматизацию сразу со всех звонков?

Практичнее начать с ограниченного повторяющегося сценария, определить его границы и проверить качество до расширения охвата.

Что важно при использовании клонированного голоса?

Нужно подтвердить права на исходную запись и условия коммерческого использования, получить необходимое согласие и предусмотреть понятную процедуру его отзыва.

Актуальные показатели
0Просмотры
0Охват
0Лайки
0Комментарии
0Сохранения
0Репосты
Instagram

Fish Audio получила $50 млн на развитие голосовой AI-платформы с 8 млн пользователей

Открыть публикацию в Instagram ↗