Thomson Reuters выпускает собственную frontier-модель
Thomson Reuters Launches Its Own Frontier Model

Thomson Reuters объявила о запуске собственной frontier-модели, построенной на основе 175-летних данных компании. Модель, получившая название CoCo, предназначена для профессиональных пользователей в юридической, налоговой и аудиторской сферах. Она интегрирована с продуктами CoCounsel, Westlaw и Practical Law, обеспечивая точность и надежность за счет проверенных источников. Компания подчеркивает, что модель использует уникальные данные, недоступные конкурентам, что позволяет ей превосходить общие модели в специализированных задачах.
Мы создали модель, которая понимает профессиональный контекст так, как не может ни одна общая модель, потому что она обучена на данных, которые мы собирали 175 лет.
- cootsnuck
В ближайшие годы это будет происходить всё чаще. Крупные организации станут более искушёнными в операционализации своих данных, обучение и запуск LLM будут продолжать демистифицироваться и становиться доступнее, и со временем мы увидим всё больше специализированных и отраслевых моделей.
Это станет ещё одним способом монетизации ваших информационных активов, если вы крупное старое предприятие с кучей данных. Всё, что вам нужно, — это время, чтобы понять, как сделать их полезными для себя, а затем в конце концов продавать доступ к ним как угодно.
Подумайте обо всех данных, которые есть у крупных организаций и которые недоступны всем ИИ-лабораториям для поглощения.
- scirob
Может, это мой дислексический мозг, но «собственная frontier-модель» в моей голове превратилась в фундаментальную модель, обученную с нуля.
Но это на базе Qwen.
Но в любом случае, я за ИИ, так что чем больше компаний имеют больше людей с навыками для большего пост-обучения, тем круче.
- johnnypangs
Вот ещё немного технической информации о том, как это обучалось, а также ссылка для скачивания.
https://huggingface.co/thomsonreuters/Thomson-1.0-Small
(Полное раскрытие: я сотрудник TR, хотя к созданию этого я не имел отношения)
- x313
Довольно круто, что кто-то до сих пор этим занимается. Обучение собственных LLM было чрезвычайно популярно в 2023–2024 годах, когда специализированные LLM могли легко превзойти GPT в своей области. Только в моей области (налоговые/HR-технологии) я помню, что Intuit, Workday, Indeed, LinkedIn — все обучали внутренние модели.
В конце концов это перестало иметь смысл из-за стоимости инференса. Запускать что-то внутреннее с 30% загрузкой GPU слишком неэффективно по сравнению с использованием API. Не знаю, как Reuters удастся решить эту фундаментальную проблему.
- Arcuru
> начиная с сильной открытой основы и инвестируя 40 миллионов долларов в обучение Thomson
Похоже, они потратили 40 миллионов долларов на дообучение модели с открытыми весами на своих данных? Интересно, на чём они это построили.