Speko(YC S26)が音声AI向けの「OpenRouter」を発表、最適なモデルを自動選択
Launch HN: Speko (YC S26) – OpenRouter for Voice AI
Spekoは、音声AIのためのルーティングプラットフォームで、音声認識(STT)、LLM、音声合成(TTS)の各モデルを、精度、レイテンシ、コストなどの制約に基づいて自動的にベンチマークし、最適な組み合わせを選択します。公開ベンチマーク結果に基づき、モデルの切り替えをAPIで実現。ゲートウェイはオープンソースで提供され、BYOKモードでは外部通信なしで動作します。創業者のBek氏は、これまで企業向け音声エージェント開発で培った経験を活かし、モデル評価のプロセスを自動化しました。
「私たちは文字通りこのダッシュボードに行ってモデルを切り替えるだけで、それが自動でやってくれるんです」
- noagogo
音声スタックを選ぶときに2つの点で痛い目に遭った。どちらもあなたのベンチマークの軸には入っていない。
1つ目: モデルが「リアルタイム向きかどうか」は、モデルの性質ではなくトランスポートの性質だった。あるTTSをベンダー自身のガイダンスに基づいて遅すぎると切り捨てたが、ストリーミング経路で再測定したところ、非ストリーミング呼び出しが5秒かかったところが約0.9秒になった。同じモデル、同じプロバイダーだ。ベンチマークが1つのトランスポートで実行されると、実際に配信する方法では問題ないモデルが失格に見えることがある。
2つ目: 非英語の破綻は、全体的な品質数値には現れない。速度最適化層(フラッシュ/ターボクラス)は英語では問題なかったが、日本語では崩壊した。「少し悪い」というレベルではない: 文の意味を変えるような、自信満々の誤った単語だった。これが高くついたのは、ベンダー自身のドキュメントが、ターボ層はフラッシュ層と同等だと述べていたからだ。それは英語では真実だが、私が配信していた言語では真実ではなく、ドキュメントが積極的に私を間違った方向に導いた。
どちらも意味するのは、私が実際にルーティング層に払う価値があるのは、モデルごとの単一の品質/レイテンシ/コストのポイントではなく、言語別・トランスポート別の測定値だということだ。「300ms未満の最高のTTS」は英語と日本語で答えが異なり、それをどのベンダーの公開数値からも得られなかった。
それで、あなたのベンチマークは言語別ですか? そして、人々が実際に配信するトランスポートで測定していますか? もしそうなら、それは[…]よりも大きな意味を持つ。
- triumph1701
言語別・トランスポート別のポイントこそ、ルーティングベンチマークが単なる別のリーダーボードではなく有用になる点だ。スコアカードは分解して維持すべきだ: トランスポート/ストリーミングレイテンシ、言語別のWERまたはタスク精度、TTS品質、そして代表的なコンテキスト/キャッシュ分布の下での実効コスト。そして、選択されたルートとともに制約と生の測定値を公開する。そうしないと、単一の複合スコアが、英語のバッチテストでは勝つが本番のトランスポートや言語では失敗するプロバイダーを隠してしまう。
- hirak10
制約ソルバーで見たいのは、リスト価格ではなく実効コストだ。LLMレッグだけでも、現在の5.6価格は272K入力トークンで分割され、ロングバンドはちょうど2倍、キャッシュされた入力は標準入力より90%低い。だから、同じリスト価格の2つのスタックでも、プロンプトのどれだけが安定したプレフィックスかによって数倍異なる可能性がある。
オプティマイザーはキャッシュヒット率とコンテキスト分布をモデル化していますか、それともリストレートでスコアリングしていますか?
- modgate
ルーティングはテキストよりも音声でさらに理にかなっているが、制約空間はよりトリッキーだ: レイテンシ予算(ラウンドトリップ vs ストリーミング)、アクセントのある音声のWER、TTSの自然さはすべて非線形にトレードオフする。私たちの音声パイプラインでは、DeepSeek-V4-Proと小さな専用STTの組み合わせが、300msの追加レイテンシ予算内に収まりながら、エンドツーエンドのフロンティア音声モデルをコスト/分で約10倍上回った。それは純粋にコンポーネントを混ぜて合わせることができたからだ。難しいのは正直なベンチマークだ: WER数値は同じ評価セット内でのみ比較可能なので、「最適な組み合わせを見つける」サービスはその方法論で生きるか死ぬかだ。コンポーネントごとのベンチマーク(STT WER、TTS MOS)を個別に公開していますか、それとも複合スコアだけですか?
- webo
ベンチマークページは興味深く、情報に基づいた決定をするのに役立ちそうだ。これらをどのように測定しているか話せますか? 人間の入力が関わっている必要があると思います。