Whistle: распознавание речи в файле на 16,9 МБ
Whistle: Speech to Text in 16.9 MB
Cactus Compute выпустила Whistle — модель распознавания речи, которая занимает всего 16,9 МБ, работает на CPU без зависимостей и загружается в тот же C++ движок, что и Needle. Она поддерживает семь языков, выдаёт первый токен за 11 мс и может объединяться с Needle, превращая аудиоклип прямо в вызовы инструментов. Модель обеспечивает транскрипцию, временные метки слов и речевые эмбеддинги, а её качество превосходит Whisper base на нескольких бенчмарках при в 8,6 раза меньшем размере.
Whistle is ahead on LibriSpeech test-clean and test-other, on SPGISpeech, on Earnings-22 and on the FLEURS average. Whisper base is ahead on TED-LIUM, on AMI and on the MLS average, at 145.3 MB against 16.9.
- skolos
Интересно, что это здесь. Я использовал whistle (и кучу других вещей), чтобы получить контроль над своим echo show. Теперь он вообще не звонит в Amazon — вся обработка идёт локально на его собственном CPU, и он подключается к моему homeassistant для домашней автоматизации. В моей первоначальной настройке использовался qwen asr (модель 1.7b), работающий на rtx 5080. По сравнению с ним whistle был реально плох (из 170 сообщений qwen распознал правильно 168, whistle — 70), но я настроил whistle так, чтобы он работал как jev — вместо свободной транскрипции он распознаёт только определённый набор шаблонов (я обучил крошечную сеть на 10 000 сгенерированных фраз, чтобы переводить финальное состояние whistle в вероятности по шаблонам). Точность выросла до 164/170 — почти как у qwen. Кстати — я говорю с сильным акцентом.
- INTPenis
Не думаю, что сложность распознавания речи заключалась в размере бинарника. По моему опыту, сложность в том, чтобы понимать моего 84-летнего отца-хорвата с отвисшей челюстью после инсульта, когда он пытается написать свою автобиографию.
Я как раз на прошлой неделе настроил для него Windows speech to text, и здорово видеть, как он может написать целую страницу за 10 минут, а с клавиатурой на это ушли бы дни.
Но каждый издаваемый им звук тоже попадает на страницу.
- jakobov
ZWhispr — вот что сейчас в тренде
- albert_e
Чего демо не делает, так это не показывает потоковый вывод транскрибированного текста по мере того, как мы говорим и записываем (до того, как нажмём стоп). По-моему, это важнейшая функция для большинства универсальных live STT-приложений.
- zimpenfish
Попробовал на случайном эпизоде ТВ, и, похоже, иногда он застревает, просто выдавая "Thank you." по умолчанию — в какой-то момент выдал это на 60 секунд диалога (и нет, в эпизоде никто не повторяет "Thank you." 60 секунд). За время транскрипции такое случается несколько раз.
- wkcheng
Как это сравнивается с Parakeet? Я использовал его локально в своих проектах на macbook серии M, и он отлично работал. Он быстрый и достаточно точный для моих задач (транскрипция встреч, транскрипция аудио для демо-видео и т.д.)
Это определённо выглядит легче и быстрее. А как насчёт точности?
- flowerlad
Apple нужно как можно скорее внедрить это в iOS. При использовании технических терминов это работает намного лучше, чем распознавание речи в iOS. Одна из самых раздражающих вещей в iOS — это speech-to-text в iMessage. Для меня нет более важной функции в телефоне.
Попробуйте такой пример: My website uses ASP.NET technology and I am using .NET 10.0. В Whistle работает идеально, а в iOS — нет.
- andy_ppp
Вау, конечно, в английском это невероятно точно — я пытался его сломать, и он понял меня идеально!
Знаю, что это немного не по теме, но неужели сейчас так сложно обучить проверку орфографии, которая не бесит всех, кто ей пользуется (это я про тебя, Apple)?!