Desert Ant Labs lanza 18 modelos de IA que corren en tu móvil sin coste por uso

Desert Ant Labs: local, fast models that run on device

Desert Ant Labs lanza 18 modelos de IA que corren en tu móvil sin coste por uso

Desert Ant Labs, un laboratorio europeo de IA, presenta 18 modelos especializados de audio, visión y texto que funcionan directamente en el dispositivo. Voz transcribe 10 minutos de audio en dos segundos, un 4.7x más rápido que Whisper, y Clear convierte una grabación de cinco minutos en audio de estudio en un segundo con solo 9MB. Un SDK para Swift, Kotlin y JavaScript, gratis hasta 100.000 dispositivos activos al mes.

Hay más cómputo disponible en las manos de la gente que en todos los centros de datos de IA de la Tierra.
  1. 1dom

    Esta es una forma genial de abordar los modelos de IA. Soy un gran fan de los LLM locales, los modelos locales específicos como este deberían ser aún más potentes.

    > Todos los modelos son gratuitos hasta 100k dispositivos activos mensuales. Sin tokens, sin inicios de sesión.

    No sé qué pensar del modelo de negocio, sin embargo. La facturación de los LLM en la nube tiene sentido: estás consiguiendo que otra computadora haga el trabajo con cada solicitud, y usando su cómputo a través de su puerta de enlace por la que te cobran.

    Estos modelos locales son como el software de la vieja escuela. Producen los pesos y luego se los dan a la gente. Si estoy contento con los pesos que me has dado, y no estoy usando tu cómputo para inferencia ni quiero ni necesito actualizaciones tuyas, ¿por qué deberías seguir sacando dinero de mí y de mis clientes?

    Todo eso de "pero necesitamos mantenerlo actualizado para tu seguridad" no funciona tan bien para software diseñado para ejecutarse completamente offline como estos modelos locales.

    No digo que no deban cobrar, pero supongo que siento una tristeza personal de que sea menos obvio cómo monetizar con éxito un enfoque tan sinceramente útil y beneficioso hacia los modelos de IA.

  2. shelled

    Hace poco tuve que usar dictado durante unas semanas y me sorprendió gratamente que muchas de las apps (en uso/vogue) sí soportaran modelos en mi Mac M1 Pro de 2021 con 16GB (muchas de ellas incluso soportaban conectarse a un endpoint de modelo remoto o local) y al mismo tiempo, para cualquier mejora de STT que valiera la pena, el tamaño del modelo alcanzaba un punto más alto del que habría querido cómodamente. Aunque ya no necesito necesariamente el dictado, tengo la intención de mantener una configuración personalizada totalmente offline y probar estos modelos (no estoy seguro de que soporten STT en vivo/streaming).

    Si a alguno de ustedes le interesa, hay apps como https://github.com/altic-dev/FluidVoice (esta es una gran app) y esta https://sam-pop.github.io/WhisperDictation. La última, aunque solo tiene 7 estrellas ahora mismo, parece ser más "intuitiva". Solo espero que expongan una forma de "conectarse" a los modelos disponibles en la máquina o de forma remota).

  3. momojo

    > El mundo envía más de mil millones de teléfonos, tablets y laptops capaces al año, la mayoría con un chip construido exactamente para este trabajo, pagado y inactivo la mayor parte del día. Ejecuta el modelo ahí y la economía se invierte: sin coste por llamada, sin ida y vuelta, y nada sale del dispositivo.

    Esto. Yo ejecuto modelos pequeños (>50MB) para aplicaciones de bioimagen/biotecnología, y parece que cada README implica que necesitas una GPU dedicada para empezar. Aunque algunos sí, muchos, especialmente los más útiles, no. Claro que importa si también vas a hacer fine-tuning, pero creo que el usuario típico solo quiere detectar algunos núcleos y obtener algunas proporciones de cuerpos celulares.

    La laptop en tu escritorio no va a ejecutar el SAM de Meta, pero tiene más que suficiente cómputo para procesar cientos de tus portaobjetos H&E durante la noche.

  4. nater5000

    Definitivamente creo que hay mucho por hacer con modelos pequeños dedicados a tareas específicas. Siempre he pensado que el VERDADERO valor está en que los modelos grandes puedan construir fácilmente modelos pequeños para tareas personalizadas (lo cual sé que más o menos existe), pero quizás simplemente proporcionar los modelos pequeños directamente sea el enfoque más accesible.

    > accesible a través de un SDK para Swift, Kotlin y JavaScript

    Jaja, bueno, avísenme cuando haya un SDK de Python y lo probaré entonces. Obviamente esto no es un impedimento si tienes un caso real, pero como alguien dispuesto a montar algo y probarlo si hay un comando rápido de "pip install", esto queda de vuelta en la estantería por ahora.

  5. sipjca

    al principio me emocioné mucho con un nuevo modelo de transcripción rápido (voz) pero resulta que es solo parakeet v3 con algo de código de inferencia nuevo que es específico de macOS/iOS

Más de este día

2026-09-10