SberDevices представил семейство ИИ-моделей для распознавания речи и эмоций
Команды разработки сервисов GigaChat и SaluteSpeech в SberDevices представили нейросеть GigaAM (Giga Acoustic Model) — семейство акустических моделей для русского языка, которые позволяют распознавать речь и эмоции. В семейство вошли три модели: GigaAM, GigaAM-CTC и GigaAM-Emo.
- GigaAM — Audio Foundation Model, предобучена на разнообразной русской речи. Можно использовать для адаптации под разные задачи работы со звуком, в том числе для распознавания речи и эмоций, определения диктора и другие.
- GigaAM-CTC — открытая модель для распознавания запросов на русском языке. Оценка качества на 7 срезах данных (от запросов в «умные» колонки до записей из телефонного канала) показала, что модель допускает в коротких запросах на 20–35% меньше ошибок в словах по сравнению с такими решениями, как NeMo-Conformer-RNNT и Whisper-Large-v3.
- GigaAM-Emo — акустическая модель, созданная для определения эмоций. По данным SberDevices, продемонстрировала лучший результат на крупнейшем датасете Dusha среди известных моделей.
«Улучшенные версии этих моделей бизнесу доступны на нашей платформе для синтеза и распознавания речи SaluteSpeech API, а физические лица также могут ими воспользоваться в приложении SaluteSpeech App», — рассказали в компании.
Узнать технические детали о дизайне моделей, подходах к обучению и используемых технологиях можно в статье на Хабр.
Все модели размещены в открытом доступе с некоммерческой лицензией.