VR 遇冷,Audio AR 正悄然崛起

The Rise of Audio AR

VR 遇冷,Audio AR 正悄然崛起

当 VR 和 AR 的喧嚣逐渐退去,AI 成为新宠时,Audio AR 正凭借智能耳机、语音识别和 LLM 的成熟悄然渗透进我们的生活。从 Microsoft Soundscape 到 FourSquare MarsBot,早期的探索虽未大成,却为今天铺平了道路。如今,Meta Wayfarer 眼镜和 Apple Fitness 应用展示了两种截然不同的交互模式:前者通过“拉取”式交互避免干扰,后者在特定场景下自信地“推送”信息。真正的挑战在于如何在正确的时间提供正确的信息,既不过度打扰,又不显得无用。Audio AR 正在重塑我们与技术的互动方式,让信息在无需低头查看屏幕的情况下自然流淌。

Audio AR 将在我们无需转移注意力的情况下,在正确的时间提供正确的信息。
  1. KaiserPro

    TLDR:获取上下文很难。

    要获得良好的上下文,你需要视频数据。要获得良好的视频数据,你需要摄像头,而且得很多,还得戴在头上。

    要把它们戴在头上,它们就必须小巧轻便。

    要让它们运行,你需要电池。但如果不使用线缆,能塞进的最大电池容量大约只有 1-1.5 瓦时。

    此外,如果不定制无线协议,你使用 iPhone 时能可靠期望的最大带宽约为 1 Mbps。

    这意味着你需要将周围的世界压缩到每秒 1 Mbps。

    不过,通过一些工作,比如利用眼动追踪来分割你实际注视的区域(通常是一个 64x64 像素的图像,帧率为 15-20 帧/秒),并在场景变化时偶尔捕捉广角视图,你完全可以构建出非常出色的上下文,甚至能让人阅读书籍。

    但你也同样需要优质的位置数据,以及房间分类来获取上下文。你没法真的用 GPS,因为精度不够,而且在室内效果也不太好。所以你会使用视觉里程计。

    一旦你拥有了所有这些,接下来就需要教会机器理解这 1 Mbps 的流数据,以判断它是否知道你需要的那个答案。哦对了,这一切还得在一台拥有约 10-15 瓦时电量的设备上运行,或者通过补丁网络卸载到一台“大男孩”机器上。

    即:https://www.projectaria.com/

  2. 4d4m

    音频 AR 是一项受欢迎的增强功能(它自身也有问题,但潜在隐私风险比视频采集要小得多)。现在有一整套支持音频 AR 的眼镜,它们更侧重于通过音频来服务用户,而不是像许多被大型广告公司大力推销的“智能”变态眼镜那样,肆无忌惮地进行全量视频采集。

  3. riedel

    这让我想起了 MIT 媒体实验室 1999 年的“游牧无线电”(Nomadic Radio):https://www.youtube.com/watch?v=l99vjTHWhk8

同日更多故事

2026-09-26