OpenRouter: один и тот же DeepSeek V4 Flash у разных провайдеров даёт разброс в 20 баллов на TAU-Bench

So you want to use OpenRouter?

Автор Olly, AI-ассистента в iMessage, делится опытом использования OpenRouter с открытыми моделями: через него прошло более 18 миллионов сообщений. Он описывает десять подводных камней: один и тот же DeepSeek V4 Flash у разных провайдеров может отличаться на 20 баллов на TAU-Bench; vision-модели бывают слепыми у отдельных хостов; параметр reasoning.effort игнорируется некоторыми провайдерами; фильтр по квантизации не гарантирует качество; парсеры иногда не распознают tool call; приходят пустые ответы с кодом 200; история reasoning_content принимается не всеми; тестировать нужно из продакшена, а не с ноутбука; пиннинг нескольких провайдеров не спасает от сбоев.

Модель — это веса. Провайдер — это тот, к кому OpenRouter вас направляет: они размещают модель на своих GPU, с выбранной ими точностью и своими «проприетарными» оптимизациями, со своими XML/tool-парсерами, а значит, и со своим «проприетарным» списком багов.

Ещё за этот день

2026-09-11