Desert Ant Labs запускает локальные ИИ-модели, которые работают прямо на устройстве
Desert Ant Labs: local, fast models that run on device

Европейская лаборатория Desert Ant Labs представила 18 компактных моделей для аудио, видео и текста, работающих локально на устройствах. Модели, такие как Voz (транскрипция в 4,7 раза быстрее Whisper) и Clear (9 МБ для улучшения звука), обеспечивают миллисекундные ответы и нулевую стоимость вызовов. Они доступны через единый SDK для Swift, Kotlin и JavaScript, бесплатны до 100 000 активных устройств в месяц и не отправляют данные в облако.
Когда вывод стоит ничего, способ создания продуктов меняется полностью.
- 1dom
Это классный подход к ИИ-моделям. Я большой фанат локальных LLM, а локальные специализированные модели вроде этой должны быть ещё мощнее.
> Каждая модель бесплатна до 100 тыс. активных устройств в месяц. Никаких токенов, никаких логинов.
Насчёт бизнес-модели я, честно говоря, не уверен. Биллинг облачных LLM имеет смысл: ты получаешь ещё один компьютер, который выполняет работу при каждом запросе, и используешь их вычисления через их шлюз, за который они выставляют счёт.
Эти локальные модели — как софт старой школы. Они создают веса, а потом отдают их людям. Если меня устраивают веса, которые ты мне дал, я не использую твои вычисления для инференса и не хочу и не нуждаюсь в обновлениях от тебя, почему ты должен продолжать получать деньги с меня и моих клиентов?
Вся эта история про «но нам нужно обновлять его для вашей безопасности» не очень-то работает для софта, рассчитанного на полностью офлайн-работу, как эти локальные модели.
Я не говорю, что им не должны платить, но, наверное, мне лично грустно, что не так очевидно, как успешно монетизировать такой искренне полезный и благотворный подход к ИИ-моделям.
- shelled
Недавно мне пришлось несколько недель пользоваться диктовкой, и я был приятно удивлён, что многие приложения (в use/vogue) поддерживали модели на моём Mac 2021 года с 16 ГБ M1 Pro (многие из них даже поддерживали подключение к удалённому или локальному эндпоинту модели), и при этом для любого стоящего улучшения STT размер модели оказывался выше, чем мне бы комфортно хотелось. Хотя диктовка мне больше не особо нужна, я намерен сохранить кастомную полностью офлайн-конфигурацию и попробовать эти модели (не уверен, что они поддерживают live/стриминговый STT).
Если кому-то интересно, есть такие приложения, как https://github.com/altic-dev/FluidVoice (это отличное приложение) и вот это https://sam-pop.github.io/WhisperDictation. Последнее, хоть у него сейчас всего 7 звёзд, кажется более «интуитивным». Просто надеюсь, они предоставят способ «подключаться» к доступным моделям на машине или удалённо)
- momojo
> Мир ежегодно выпускает более миллиарда способных телефонов, планшетов и ноутбуков, большинство с чипом, созданным ровно для такой работы, оплаченным и простаивающим большую часть дня. Запустите модель там — и экономика переворачивается: никаких затрат на вызов, никакого кругового обмена, и ничего не покидает устройство.
Вот именно. Я запускаю маленькие модели (>50 МБ) для задач биоимиджинга/биотеха, и такое ощущение, что каждый README подразумевает, что для начала нужна дискретная видеокарта. Хотя некоторым и нужна, многие, особенно самые полезные, — нет. Конечно, это важно, если вы ещё собираетесь заниматься дообучением, но, полагаю, типичный пользователь просто хочет обнаружить какие-нибудь ядра и получить соотношения клеточных тел.
Ноутбук на вашем столе не потянет Meta's SAM, но у него более чем достаточно вычислений, чтобы за ночь перемолоть сотни ваших стёкол H&E.
- nater5000
Определённо, в маленьких моделях под конкретные задачи можно много чего сделать. Я всегда думал, что НАСТОЯЩАЯ ценность в том, чтобы большие модели могли легко создавать маленькие модели под кастомные задачи (знаю, что такое вроде бы уже есть), но, возможно, просто предоставлять маленькие модели напрямую — более доступный подход.
> доступны через один SDK для Swift, Kotlin и JavaScript
Лол, ну дайте знать, когда появится Python SDK, тогда и попробую. Очевидно, это не критично, если у вас есть реальный кейс, но как человек, готовый что-то поднять и попробовать, если есть быстрая команда «pip install», я пока откладываю это на полку.
- sipjca
сначала я очень воодушевился новой быстрой моделью транскрипции (voz), но оказалось, что это просто parakeet v3 с новым кодом инференса, специфичным для macOS/iOS