Aleph Alpha выпустила Kolibri: суверенная открытая модель с 78 млрд параметров

Kolibri Has Landed: A Sovereign Open-Weight Model

Aleph Alpha выпустила Kolibri: суверенная открытая модель с 78 млрд параметров

В День германского единства Aleph Alpha представила Kolibri — англо-немецкую Mixture-of-Experts Transformer с 78 млрд общих параметров и 3 млрд активных. Модель поддерживает контекст до 1 млн токенов, выложена на Hugging Face под лицензией Apache 2.0. Kolibri создана для суверенных задач в госсекторе, промышленности и аэрокосмической отрасли: она обучена на 21,3% немецких данных, следует EU AI Act и GDPR, а благодаря протоколу Merlin-Arthur умеет воздерживаться от ответа при недостатке контекста.

Мы создали модель в Германии, обучили её на инфраструктуре в Германии и Финляндии, в соответствии с европейским и немецким законодательством, без иностранного контроля.
  1. miellaby

    В статье абсолютно всё объясняется так, будто это туториал «как сделать свою собственную современную агентную LLM». Они даже рассказывают, как собрали свой датасет. https://aleph-alpha.com/downloads/tech-report.pdf ; Впервые вижу такой уровень открытости.

  2. kkm

    Спасибо команде Aleph Alpha за то, что сделали это открытым.

    Мы, как и многие другие, хотели попробовать и прогнать бенчмарки.

    В связи с этим, в качестве небольшого жеста поддержки, мы разместили Kolibri-1 и сделали его бесплатным для всех желающих на ближайшие несколько дней.

    Без GPU. Без настройки. Просто попробуйте.

    tesseracted.com/kolibri-1-chat/

    https://x.com/konarkmodi/status/2106373678589960260?s=46

  3. andai

    >Мы обучали Kolibri на данных об отказе от ответа и с нашим протоколом Merlin-Arthur. В результате она обучена говорить «Я не знаю», когда ответа нет в контексте.

    https://aleph-alpha.com/en/blog/bounding-hallucinations-merl...

  4. peterBlue75

    Здесь стоит отметить, помимо прозрачности и того факта, что это действительно хорошая модель, которая также хорошо работает на задачах кодинга и агентных задач, что это первый релиз команды, сформированной менее года назад, с сильным акцентом на скорость итераций. Продолжение следует.

    disclaimer: Я часть команды, занимавшейся обучением, готов ответить на любые вопросы

  5. tomComb

    Для поста, который делает такой большой акцент на суверенитете, немного вводит в заблуждение то, что не упоминается, что компания, как ожидается, будет объединена с Cohere, канадской компанией.

    И это хорошо — не нужно это скрывать. Учитывая растущую стоимость поддержания конкурентоспособности, этим немногим неамериканским и некитайским компаниям действительно нужно больше делиться усилиями и затратами.

    Канаде тоже очень нужны суверенные варианты ИИ, но финансировать это в одиночку было бы практически пустой тратой денег. Хотелось бы увидеть, как эта новая немецко-канадская компания сотрудничает с Mistral или, может быть, с одной из корейских ИИ-компаний.

  6. amoshebb

    Qwen3.8 27B обходит Kolibri со счётом 79,9 против 70,8 на немецком в харнессе Kolibri на бенчмарке Kolibri.

    Кроме того, после завершения поглощения Cohere смогут ли они всё ещё использовать это «суверенное» заявление, несмотря на то, что на 90% принадлежат и на 100% управляются из Торонто?

  7. niemandhier

    Думаю, на данный момент главное, в чём суверенная ИИ-модель должна быть хороша, — это аудит результатов других моделей.

    Прямо сейчас можно запустить открытую модель для большинства государственных задач, и её будет достаточно, просто ни одной из них нельзя доверять.

    Так что если суверенно контролируемая модель будет проверять первую, это по сути сработает как «адаптер доверия».

    Если вторая модель достаточно дешёвая и быстрая, появляется бизнес-модель.

    Даже не нужно проверять все промежуточные шаги, только вызовы инструментов и конечные результаты.

  8. spijdar

    Отсутствие какого-либо сравнения с Qwen3.8 Flash, ещё одной MoE-моделью с небольшим (6B) числом активных параметров, довольно бросается в глаза. Вместо этого её сравнивают с Qwen3-Next 80B-A3B, моделью, выпущенной почти год назад.

    Понимаю, что это не отменяет реальной «сути» модели, но всё же...

  9. martianvoid

    Я только что попробовал поиграться с ней на своей конфигурации с RTX pro 6000, она тратит слишком много токенов на переобдумывание всякого, даже если способна ухватить правильный подход.

    Скорость, с другой стороны, довольно хорошая: всего с 3B активных параметров я получаю около 170 tkn/s на fp8

  10. dang

    Связанная текущая ветка:

    Aleph Alpha Kolibri: How the sovereign German LLM works - https://news.ycombinator.com/item?id=49943034 - Oct 2026 (162 comments)

Ещё за этот день

2026-10-03