Jeff: домашние модели на 0.8B принимают решения за 22 мс, конкурируя с Jev

Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

Jeff: домашние модели на 0.8B принимают решения за 22 мс, конкурируя с Jev

Jeff — это дообученные Qwen3.5 и Gemma 4 для zero-shot классификации, работающие в том же формате запросов, что и Jev. Они возвращают калиброванные вероятности для каждого варианта за один прямой проход: около 22 мс на RTX PRO 6000 и 28 мс на Apple M4 Max. Обучение полностью локальное: 0.8B за 2 часа на одной GPU, данные сгенерированы открытой моделью. На бенчмарках Jeff-Qwen3.5-2B набирает 83.1% против 83.0% у Jev, но уступает в рассуждениях. Дообучение на своих примерах поднимает точность с 31.7% до 95.8% за полчаса.

Опишите ситуацию и перечислите варианты простыми словами; Jeff возвращает калиброванную вероятность для каждого варианта за один прямой проход.
  1. adrithmetiqa

    Простите моё непонимание, но сколько времени пройдёт, прежде чем функциональность типа Jev просто встроят во все фронтирные модели?

  2. AgentMasterRace

    Я сравнил его с Jev в своих текущих сценариях использования, и он очень неточен. 70% против 94%. Для классификации это неприемлемо.

  3. trebligdivad

    Какая доля коммерческого использования LLM приходится на классификацию? Мне просто интересно, что произойдёт с корпоративными расходами на ИИ и использованием дата-центров, когда они поймут, что им не нужны полноценные LLM.

  4. phlipski

    Для тех, кто определённого возраста — сам факт, что Askjev.com всё ещё доступен, меня поражает.

  5. imranq

    Все, кто говорит, что можно заменить Jev или модели типа decision с помощью LLM с прикрученным ограничением вывода по схеме, полностью упускают суть. Речь об экстремальной скорости и экономической эффективности при высоком качестве, и ни того, ни другого вы не получите с LLM даже с этими трюками с KV-кэшем.

  6. velominati

    Typesafe довольно молчаливо обходили тему underlying technology за Jev. Учитывая скорость и стоимость, моя гипотеза такова: он не вводит токены так, как это делают LLM, то есть не перебирает каждое слово и не выстраивает связи между каждым. Это задача o(n^2), из-за чего LLM так дороги при масштабировании.

  7. qtalen

    Круто, я как раз искал модель для принятия решений, которую можно развернуть локально, а вот и вы. Большое спасибо!

  8. danbrooks

    Такой тип проекта выглядит чрезвычайно полезным. Вокруг Jev было много шума, но наличие моделей, которые работают локально и могут быть дообучены, крайне помогает.

Ещё за этот день

2026-09-28