Создан бенчмарк для проверки точности мультиязычного ASR

Бенчмарк и датасет для оценки систем автоматического распознавания речи (ASR) с переключением языков, метрики WER, SWER, AER, тестирование моделей ASR

Разработаны бенчмарк и датасет для оценки систем автоматического распознавания речи (ASR). Они помогают понять, как системы справляются с речью, где происходит переключение языков. Это особенно важно для голосовых помощников в компаниях. У них точная транскрипция предотвращает ошибки.

Как измерить качество

Качество оценивают по трем метрикам: проценту ошибок в словах (WER), точности передачи смысла (SWER) через Gemma-4-31B и уровню понимания (AER), который определяет LLM.

Какие языки и модели проверили

Бенчмарк включает пары языков: испанско-английский, французско-английский, канадский франко-английский и немецко-английский. Протестировали семь моделей ASR: ElevenLabs Scribe V2, AssemblyAI Universal 3-Pro, Google Gemini 3 Flash, Deepgram Nova-3, Mistral Voxtral Small 24B-2507, Nvidia Parakeet TDT 0.6b V3 и OpenAI Whisper Large V3 Turbo.

Главная выгода для бизнеса

Точная транскрипция речи с переключением языков минимизирует ошибки в клиентской поддержке, например, некорректное перенаправление запросов. Это позволяет голосовым помощникам эффективно общаться с клиентами по всему миру. Точная транскрипция обеспечивает корректную работу всех связанных сервисов.

Как создавался датасет

Датасет сгенерировали синтетически, используя внутренние записи HR и IT-разговоров. Тексты с переключением языков создал OpenAI/GPT-5, а аудио синтезировала ElevenLabs Multilingual V2. Лингвисты-носители проверили качество.

Результаты тестирования

Лучшими по точности транскрипции оказались ElevenLabs Scribe V2 и AssemblyAI Universal 3-Pro. Google Gemini 3 Flash показал лучшие результаты в SWER и AER, что говорит о лучшем понимании смысла для последующих задач. OpenAI Whisper Large V3 Turbo оказался последним, часто переводя речь на английский вместо транскрипции.

Что влияет на ошибки

Частота переключений языка в речи и плотность смешения языков (CMI) увеличивают количество ошибок. Они чаще возникали в английских частях речи, возможно, из-за специфической лексики.

Что это значит для бизнеса

Качество распознавания речи с переключением языков — главный индикатор надежности моделей. Лучшие модели показывают лишь незначительное снижение качества. Важно тестировать конкретные языковые пары для вашей аудитории. Рекомендуем использовать режим "автоопределения" при тестировании. Это позволяет приблизить тест к реальным условиям эксплуатации.

Ранее по теме
AI-ассистент Adobe Firefly ускоряет дизайн и обучает пользователей

Больше новостей в нашем Телеграм. Подпишись!

Ссылка на источник тык.

Read more

Интерфейс OpenClaw 2.0: автономные AI-агенты, управление терминалом и интеграция с Ollama

OpenClaw 2.0 управляет ПК через мессенджеры

Openclaw: автономные ai-агенты на вашем пк OpenClaw — это open-source фреймворк для создания автономных AI-агентов. В отличие от обычных чатов, эти помощники работают прямо на вашем компьютере и могут выполнять задачи по расписанию: управлять почтой, календарем, файлами и терминалом. Общаться с ними можно через привычные мессенджеры: Telegram, WhatsApp, Discord или Signal.

Демонстрация работы ИИ-модели Runway Solaris по созданию интерактивных интерфейсов и цифровых пространств

Runway Solaris создает приложения и сайты без кода

Runway представила Solaris — модель для создания интерактивных цифровых пространств. Теперь сайты и приложения можно собирать без навыков программирования: система сама генерирует визуал и продумывает логику интерфейса. Как это работает Систему обеспечивают две технологии: движок рендеринга и языковая модель. Solaris отрисовывает кадры, а модель определяет, как должен измениться интерфейс. В итоге

Визуализация ИИ-модели OpenAI Astra, анализирующей код ПО на наличие уязвимостей в сфере кибербезопасности

OpenAI Astra находит и эксплуатирует уязвимости ПО

OpenAI представила Astra — модель, которая первой достигла качественно нового уровня в кибербезопасности. Она способна самостоятельно находить неизвестные уязвимости в ПО и использовать их. Astra умеет выстраивать цепочки из нескольких атак, что позволяет ей проникать глубоко в защищенные системы. Эффективность и практическая польза В тесте ExploitBench Astra показала идеальный результат — 100%

Новые модели Claude Fable 5.1 и Mythos 5.1 от Anthropic для программирования и AI-агентов

Claude 5.1 обогнал GPT-5.6 и подешевел на 45%

Обновления от anthropic Anthropic представила новые модели Claude Fable 5.1 и Claude Mythos 5.1. Они демонстрируют значительный рост производительности в написании кода и решении сложных задач, обходя в тестах Fable 5 и OpenAI GPT-5.6 Sol. Модель Claude Fable 5.1 доступна всем пользователям, в то время как

Хочешь больше информации про автоматизацию и AI?

В ТГ-канале «Дети нейросети» рассказываю про автоматизацию бизнеса.

Автоматизироваться
Дети Нейросети © 2026