Audio ARが静かに日常へ浸透する理由
The Rise of Audio AR

VR/ARの熱狂が去った後、スマートヘッドフォン、音声認識・合成、LLM、位置情報データの進化により、Audio ARが現実味を帯びている。Microsoft SoundscapeやFoursquare MarsBotの先駆的試みを経て、MetaのWayfarerやApple Fitnessなどが実用化。課題は「適切な情報を適切なタイミングで届ける」UXにあり、プッシュ型とプル型のバランスが鍵となる。
Audio ARのアプリケーションにとっての核心的なUX課題は、適切な情報を適切なタイミングで届けることだ。
HNでの議論
21- KaiserPro
TLDR: コンテキストが難しい。
良いコンテキストを得るには、ビデオデータが必要だ。良いビデオデータを得るには、カメラが必要で、しかも大量に、頭に載せなければならない。
頭に載せるには、小さくて軽くなければならない。
動かすにはバッテリーが必要だ。しかし、有線なしで得られる最大のバッテリーサイズは約1〜1.5ワット時だ。
そして、独自の無線プロトコルを作らない限り、ユーザー(iPhoneで)が確実に期待できる最大帯域幅は1メガビットだ。
つまり、周囲の世界を毎秒1メガビットに圧縮する必要がある。
さて、少し工夫すれば、アイトラッキングを使って実際に見ているもの(通常は64x64ピクセルの画像を毎秒15〜20フレーム)をセグメント化し、シーンが変わったときに時折広角ビューを使うことで、本を読むことさえ含めて、本当に良いコンテキストを構築できる。
しかし、コンテキストを得るには、良い位置データと部屋の分類も必要だ。GPSは十分に正確でなく、屋内ではあまりうまく機能しないので、実際には使えない。だから視覚オドメトリを使う。
それが全部揃ったら、次にその1Mbitストリームを理解して、必要な答えを知っているかどうかを判断するように機械を教えなければならない。しかもそれは約10〜15ワット時のデバイスで動作するか、パッチングネットワーク経由でビットボーイマシンにオフロードする必要がある。
- 4d4m
Aarは歓迎すべき強化だ(それ自体の問題はあるが、ビデオキャプチャよりはプライバシー問題が少ない可能性がある)。大規模な広告企業が売り込んでいる多くの「スマート」変態メガネのように無謀な完全ビデオキャプチャではなく、音声を通じてユーザーに焦点を当てたAar対応メガネが一揃いある。
- riedel
MIT Media Labの「Nomadic Radio」(1999年)を思い出す: https://www.youtube.com/watch?v=l99vjTHWhk8