AI 正在挣脱屏幕:语音,才是它最自然的入口

0 次阅读 2026年07月21日
智能手机的逻辑,正在被AI瓦解 智能手机统治了过去十几年的数字生态,它是注意力的黑洞,是我们最私密的随身之物。但手机从设计之初就是为「人盯着它」而生的——它的全部逻辑,都止于屏幕。AI 的需求却恰恰相反:它需要持续感知物理世界——见你所见,听你所闻,随时在场,而非等你解锁屏幕才醒来。当 AI 真正成为一种基础能力,它迟早要从屏幕里破壳而出,寻找属于它自己的形状。这将是一个漫长的探索和演化过程。 语音不是退化,而是回归本源 过去两年,AI 的定位已悄然转变:从少数人的专业工具,变成日常生活的基础能力。我们早已习惯在走路、开车、做饭甚至摸鱼时,随时随地向 AI 发出指令。但以键盘打字为主的交互方式,正暴露出根本性短板——它要求用户先有清晰想法,再组织语言、保持逻辑,才能把脑海中的意图转化为 AI 可理解的提示。这个过程本身,就与人类思维的流动方式相悖。 语音则不同。讲话允许一边输出、一边思考、补充和修正,更贴近思维原本的发生节奏。它不依赖桌面环境,不要求低头凝视,也不考验文字表达能力。对绝大多数未接受系统写作训练的普通人而言,语音才是真正的「自然交互」。 三种语音入口的演进路径 第一种是「耳机+手机」组合。一副 TWS 耳机加现有手机系统,就能构成一个 24 小时在线的虚拟副手。无需专用硬件,即可将散碎指令送达任意 AI 模型。它的速度、兼容性和跨设备能力,至今仍优于多数所谓「开创性」的 AI 专用设备。真正的瓶颈不在算力,而在麦克风——尤其在多人环境中,环境人声混入导致提示词失真,AI 回答便彻底跑偏。于是,耳机麦克风的价值正在重估:音质、延迟、降噪之外,人声分离能力、降噪强度与准确率,已成为衡量新一代 AI 控制器的核心指标。 第二种是智能眼镜。尽管宣传强调 HUD(平视显示),但真正走通的商品化路径,仍是「看见什么问什么,AI 讲给你听」。其本质并非视觉增强,而是语音触发的场景化问答。问题在于,眼镜的「无感」常停留在宣传片里——持续朝向他人时,拍摄与收音的不确定性天然制造社交压力;受限于体积与续航,其麦克风阵列与音频效果未必优于成熟 TWS;更关键的是,主流产品普遍深度绑定自家模型与云服务,用户丧失模型选择权、数据迁移自由与跨平台灵活性。例如 Meta Ray-Ban 眼镜强制接入 Meta AI,无法作为通用蓝牙设备唤醒 Siri 或其他助手。 第三种是独立语音硬件入口。2026 年起,一批专为语音输入设计的物理设备开始浮现。如 OpenAI 与 Work Louder 联名推出的 Codex Micro,虽无内置麦克风,却专门设置了一个 push-to-talk(PTT)按键。这一设计具有标志性意义:语音输入不再只是 UI 中的一个小图标,而拥有了类似拍照键、指纹键一样的稳定物理位置。它承认了一件事——对某些用户而言,语音触发的频率,可能已超过键盘上大多数字母键。 无声语音:下一阶段的临界点 语音交互的终极形态,或许根本不需要发声。近期出现的「超声波舌部动作识别」设备,通过下颌处的超声探头捕捉舌头运动,再经机器学习解码为语言;另一些研究则将传感器嵌入眼镜或头显,通过面颊、颧骨与口周肌肉的细微活动识别无声指令。这些技术尚处实验室阶段,识别范围窄、准确率有限、佩戴体验待优化,但方向已然清晰:未来的「语音输入」,将演进为对人类发声意图的直接感知——口型、舌位、面部肌电,皆可成为指令信号。 便利背后的隐性代价 语音之所以在 AI 时代崛起,并非因为它更「高效」,而是因为它更「本源」。人类不是纯粹的视觉动物;30 万年来,我们始终用声音传递信息——咕咕嘎嘎,比比划划,效率高得多。用语音指挥 AI,消弭了工具感:无论你潜意识中把它当作秘书、同事还是伙伴,对话总比填表更接近人类协作的本质。 但便利是有成本的。传统语音转文本(STT)仅消耗文本 token;而 Typeless 类工具需额外调用模型清洗口语,再将整理后文本送入主模型,token 成本翻倍;当多模态模型进入「原生音频」阶段,持续处理语气、打断、上下文与实时反馈,单次对话的 token 消耗可达纯文本的 10 倍以上。尤其在长时间对话中,用户无法像打字那样主动控制输入长度,模型却必须全程维持连接、理解语境、生成响应——计算负担陡增,费用随之攀升。 这几乎成为一种公开的商业逻辑:鼓励语音交互,既提升用户体验,也显著拉升 token 消耗。因此,未来竞争的关键,不再是「能不能听懂」,而是「能否以更低延迟、更少冗算、更透明计费,平衡多模态业务间的成本鸿沟」。让人们开口不难,难的是——让他们愿意一直说下去。

(6)

微光前行

语音回归本源挺好,但像智能眼镜那些限制太多,用起来不得劲儿。

0
陈煜彬.
陈煜彬. 1周前

这几种入口都有短板,无声语音技术还不成熟,离完美远着呢。

0
想理汽车法务部

耳机麦克风得改进,智能眼镜社交压力大,独立硬件看着还行,还得看发展。

0
葱葱
葱葱 1周前

AI 从屏幕挣脱是趋势,语音交互是必然,不过这几种入口都有问题,成本控制也得重视。

0
忘轻风(攀岩等雪季)

AI 语音交互成本上升是个大问题,能平衡成本的企业才行。

0

新东方第四季度净营收15.3亿美元,预估14.7亿美元;第四季度经营利润8,580万美元,预估7,550万美元。

新东方第四季度净营收15.3亿美元,预估14.7亿美元;第四季度经营利润8,580万美元,预估7,550万美元。

韩国三家造船厂第二季度营业利润突破2.7万亿韩元 得益于高附加值LNG运输船

今年二季度,韩国三大国内造船厂业绩强劲,综合营业利润超过2.7万亿韩元,主要得益于液化天然气(LNG)运输船等高附加值船舶比例的增加。据业内消息,29日,HD韩国造船海上工程[009540]、韩华海洋[042660]和三星重工业[010140]在第二季度实现了2.7062万亿韩元的合计营业利润。总销售额为17.609万亿韩元。造船热潮期间订购的高价船舶现已反映在销售中,生产力提升和选择性订单策略被认为提升了盈利能力。

纳指科技ETF景顺(159509)将于2026年7月30日开市起停牌,自2026年7月30日10:30起复牌,停牌期间赎回业务照常办理。

纳指科技ETF景顺(159509)将于2026年7月30日开市起停牌,自2026年7月30日10:30起复牌,停牌期间赎回业务照常办理。

美光科技、闪迪、SK海力士等存储股盘前全线转涨

7月29日,美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。希捷科技、西部数据分别上涨4.6%、2.2%。

贝莱德盘前续涨约2% 联手Meta,加码AI基建

7月29日,全球资产管理巨头贝莱德(BLK.US)美股盘前续涨约2%。消息面上,据彭博消息,科技巨头Meta近日与贝莱德联合宣布,双方达成合作设立合资企业,共同开发运营坐落于美国得克萨斯州埃尔帕索的大型AI数据中心园区,项目整体开发投入规模达140亿美元,将为人工智能算力基础设施建设提供强力支撑。此次合作让贝莱德深度参与AI基础设施投资,契合当前市场热点,直接提振了投资者情绪。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月23日从11.00%降至10.48%,卖出的平均股价为34.4085港元。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月23日从11.00%降至10.48%,卖出的平均股价为34.4085港元。

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。

香港交易所信息显示,德意志银行在哔哩哔哩-WH股的持股比例于07月24日从18.18%升至19.04%。

香港交易所信息显示,德意志银行在哔哩哔哩-WH股的持股比例于07月24日从18.18%升至19.04%。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月24日从10.48%升至11.44%,购买的平均股价为33.2783港元。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月24日从10.48%升至11.44%,购买的平均股价为33.2783港元。

阿达尼企业第一季度亏损116亿卢比,去年同期盈利88.5亿卢比。

阿达尼企业第一季度亏损116亿卢比,去年同期盈利88.5亿卢比。