Whistle: reconocimiento de voz en solo 16,9 MB

Whistle: Speech to Text in 16.9 MB

Whistle es un modelo de reconocimiento de voz de 16,9 MB que corre en CPU sin dependencias y se integra en el mismo motor C++ que Needle. Transcribe siete idiomas, alcanza el primer token en 11 ms y ofrece marcas de tiempo y embeddings de audio. Supera a Whisper base y Moonshine tiny v2 en varios benchmarks, con una fracción de su tamaño.

  1. skolos

    Interesante que esto esté aquí. Usé whistle (y un montón de otras cosas) para tomar el control de mi echo show. Ahora no marca a Amazon en absoluto: hace todo el procesamiento localmente con su propia CPU y se conecta a mi homeassistant para la domótica. Mi configuración inicial incluía qwen asr (modelo de 1.7b) corriendo en una rtx 5080. En comparación, whistle era realmente malo (de 170 mensajes, qwen reconoció correctamente 168, whistle - 70), pero ajusté whistle para que funcionara como jev: en lugar de transcripción libre, reconoce solo un conjunto selecto de plantillas (entrené una red diminuta con 10,000 enunciados generados para traducir el estado final de whistle a probabilidades dentro de las plantillas). La precisión subió a 164/170, casi igualando a qwen. Por cierto, hablo con un acento muy marcado.

  2. INTPenis

    No creo que el desafío con el reconocimiento de voz a texto fuera el tamaño del binario. En mi experiencia, el desafío es entender a mi padre croata de 84 años con la boca caída después de un derrame cerebral, cuando intenta escribir su autobiografía.

    Acabo de configurar el reconocimiento de voz a texto de Windows para él la semana pasada y es genial ver cómo puede escribir una página entera en 10 minutos; con el teclado le llevaría días.

    Pero cada sonido que hace con la boca también termina en la página.

  3. jakobov

    ZWhispr es lo que se lleva

    https://zwhispr.com/

  4. albert_e

    Lo que la demo no hace es mostrar la salida en streaming del texto transcrito mientras hablamos y grabamos (antes de pulsar stop). Esa es una característica esencial en mi opinión para la mayoría de las aplicaciones de STT en vivo de propósito general.

  5. zimpenfish

    Lo probé con un episodio de TV aleatorio y parece atascarse a veces, donde simplemente emite "Thank you." como valor predeterminado; en un momento lo emitió durante 60 segundos de diálogo (y no, el episodio no tiene a alguien repitiendo "Thank you." durante 60 segundos). Ocurre varias veces durante la transcripción.

  6. wkcheng

    ¿Cómo se compara esto con Parakeet? He estado usando eso localmente en mis proyectos en un macbook de la serie M y ha funcionado muy bien. Es rápido y lo suficientemente preciso para mis casos de uso (transcripción de reuniones, transcripción de audio para videos de demostración, etc.)

    Esto definitivamente parece más ligero y rápido. ¿Cómo se compara la precisión?

  7. flowerlad

    Apple necesita incorporar esto en iOS lo antes posible. Esto funciona mucho mejor que el reconocimiento de voz en iOS cuando usas términos técnicos. Una de las partes más frustrantes de iOS es el texto a voz en iMessage. Para mí, ninguna característica es más importante en un teléfono.

    Prueba este ejemplo: Mi sitio web usa tecnología ASP.NET y estoy usando .NET 10.0. Funciona perfectamente en Whistle, pero no en iOS.

  8. andy_ppp

    ¡Wow, ciertamente en inglés esto es increíblemente preciso, intenté romperlo y me entendió perfectamente!

    Sé que está un poco fuera de tema, pero seguramente ya debe ser fácil entrenar un corrector ortográfico que no moleste a todo el mundo (¡te estoy mirando a ti, Apple)!

Más de este día

2026-10-08