Лучший AI-агент решает лишь 38,8% задач на приватных корпоративных кодовых базах
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
Specific Labs выпустила бенчмарк Real-SWE, оценивающий frontier-модели на приватных production-кодовых базах реальных компаний. Задачи взяты из закрытых репозиториев: биллинг, налоги, миграции — работа с бизнес-последствиями. Лидер Fable 5.1 с Claude Code показал 38,8% resolution rate, GPT-6 Astra — 33,8%, Gemini 3.8 Flash — 31,2%. 71,4% коротких rollout'ов провалились. Самая частая ошибка — пропущенные требования.
99% токенов в реальных предприятиях скрыты от frontier-моделей.