黑胶带测试之后,问题从未消失
多年前,一辆小鹏汽车的中控屏被黑色胶带严严实实地封住。体验者看不见界面,也不能触碰屏幕,只能靠说话完成全部车内操作——导航、调温、播放音乐、控制车窗……所有任务最终跑通。时任小鹏语音业务负责人的赵恒艺后来回忆:“在我们的理解里,屏幕是辅助。关键是怎样通过有效沟通,帮助用户真正把事情做完。”
那场测试带着产品经理式的执拗,也悄然揭开了一个更本质的命题:当视觉退场,机器靠什么理解人?又如何预判、承接、延续人的下一步需求?
大模型没有终结语音,而是把它推回中心
多年过去,技术浪潮几经更迭。车载语音早已走出“唤醒-识别-执行”的初级阶段,开始理解语义、接受打断、调用工具、生成反馈。AI正从聊天框向现实世界伸展——不是作为插件,而是作为持续在线、跨设备、有记忆的智能体。
2025年,OpenAI收购io团队;Amazon与Meta相继整合环境式
AI与可穿戴技术公司。巨头争抢硬件入口,核心诉求清晰而一致:获取真实世界的上下文,建立全场景、不间断的人机连接。
赵恒艺说:“AI与人的连接,本就该覆盖全场景。”人从车里走进办公室,再回到家中,设备不断切换,但同一个智能体应当认出他、延续对话、调用当前设备能力。而在这条连续性链路中,声音——看不见、摸不着,却始终伴随移动、携带情绪、承载迟疑与确信——成为最自然、最富信息量的交互核心。
两个十年老兵,在Hojo汇合
2024年底,Hojo成立。创始人赵恒艺与联合创始人苏丹,一位深耕产品、硬件与供应链近十年,一位扎根模型、声学与工程同样十年。他们在语音行业相识近十载,却从未真正共事;直到大模型时代到来,技术路径收束、能力边界重定义,两人终于在同一坐标点交汇。
赵恒艺的职业轨迹,是一条语音从功能走向人格的演进线:在思必驰搭建DUI平台,在小鹏将语音装进汽车与机器人,在蔚来见证NOMI如何让用户产生情感依赖。他笃信语音不只是输入通道——停顿、重音、语速变化、语气起伏,这些无法被文字完整转译的信号,恰恰是意图与状态的关键线索。
苏丹的技术履历,则是一部语音能力的进化简史:从北大博士期间的语音识别研究,到百度推动手机近场识别落地,再到滴滴与腾讯AI Lab主导远场拾音、多模态交互与语音大模型研发。他亲历了语音从孤立模块,到被大模型重新统合为“智能体呼吸系统”的全过程。
两人创业的起点很朴素:让AI离开聊天框之后,怎样真正进入硬件,并在那里持续理解一个人?
不做通用模型,只做“进得去、稳得住、记得住”的语音栈
Hojo不训练千亿级通用大模型,也不卖单点ASR或TTS API。它选择了一条更重、更垂直的路径:面向智能硬件,构建可量产、可部署、可演进的AI Stack。
这条栈自下而上分为三层:
底层是自研语音及全模态模型——包括高鲁棒性ASR、小尺寸TTS(Hojo-TTS-Light-40M仅4000万参数)、原生全双工语音情感对话模型(首音响应进入100毫秒级)。三条模型线共享数据清洗、训练框架与评测体系,彼此反哺,形成闭环。
中间层是Agentic OS:统一调度设备能力、模型服务与外部工具;Memory Engine负责长期记忆的沉淀、检索与调用;Device Access抽象不同硬件的接入差异,屏蔽芯片、固件、声学结构带来的碎片化。
最上层面向用户:Hojo App承载核心体验,同时提供SDK与正在开发的App Studio白盒定制平台。品牌方可在配置层定义功能、界面与模型行为,由
AI自动生成配套App,大幅降低接入门槛。
不追万物互联,只挑“最重的声音”
Hojo主动收缩战场。它不入场智能家居——对空调说“调到26度”,本质是一次性开关操作,价值密度低;也不押注AI玩具——生命周期短、付费意愿弱,服务成本无法摊薄。
它锚定的是高信息密度、强工作属性、需长期记忆的场景:会议、访谈、知识型协作、专业咨询。一场两小时的律师会谈,产生的待办、承诺、责任归属与项目关联,远超百次家电控制指令的总和。
在这里,录音只是起点。Hojo App正重点打磨两类能力:一是会议级多人语音识别、精准角色分离、语义摘要与行动项提取;二是在用户授权下,管理跨设备always-on输入所形成的个人上下文——今天用录音笔记下的客户异议,明天用耳机追问进展时,系统能自动关联同一份记忆,而非开启新对话。
为支撑这一能力,Hojo计划于8月下旬开源底层Memory技术,将记忆沉淀、检索与调用能力开放给硬件伙伴与开发者。
从一家标杆客户,走向千万台设备
Hojo没有急于铺开客户数量,而是先聚焦汽车座舱——这个近乎苛刻的语音高压实验室:多人混响、风噪胎噪、弱网环境、毫秒级延迟要求。在此验证能力后,再将声学增强、端云协同、量产交付等经验,迁移至耳机、录音笔、随身记录仪等消费电子品类。
目前,Hojo已与12家硬件品牌深度对接,5家完成签约,年度设备规划超500万台,预计2026年Q4启动产能爬坡。下一目标明确:2027年接入至少1000万台设备。
它放弃智能手机市场——头部厂商掌控操作系统、账户体系与用户上下文,AI能力高度内化。Hojo选择的是更分散、更开放的战场:全球耳戴设备年出货量预计达4.076亿台,智能眼镜突破千万级,大量品牌擅长设计与渠道,却缺乏从模型到订阅的全栈能力。
定制不是终点,而是平台化的起点
硬件落地真正的挑战不在首发,而在量产后的持续交付。每家客户的麦克风阵列、SoC算力、功耗约束、方言口音、专业术语都不同,若陷入逐个项目定制,初创团队很快会被拆散、耗尽。
Hojo的答案是“Harness架构+生成式AI”。App Studio将共性能力沉淀为可配置模块:声学前端、记忆引擎、订阅计费、多端同步……品牌方只需定义Manifest配置文件,AI即可生成适配App。定制工作从人力密集型,转向技术复用型。
合作模式亦为2B2C:一类SDK白盒交付,用户关系与订阅归属品牌;另一类接入Hojo App,共享C端服务体系。双方收益绑定于用户活跃度与续费率——客户经营越好,Hojo越受益。
更重要的是,Hojo为设备生命周期提供三层兜底:模型轻量化压缩、端云动态协同、多供应商路由与缓存。旧硬件无法无限升级,但可通过模组替换或兼容设计平滑过渡,让能力更新不等于整机淘汰。
当黑胶带被撕下,新的问题才刚刚开始
多年前那条封住屏幕的黑胶带,检验的是语音能否独立完成一次任务;今天,Hojo面对的问题已截然不同:声音能否跨过设备、品牌与时间,记住一个人,并在数年的硬件生命周期里,持续为他服务?
这不是技术炫技,而是一场关于信任、连续性与真实价值的重建。当
AI真正离开聊天框,人与机器之间最自然的沟通方式,很可能仍是开口说话——只是这一次,它要听得更稳、想得更久、记得更深。
评论 (5)
这创业方向挺清晰,不搞通用搞垂直,专注特定场景,找对路没准能成。
筛选应用场景很重要,避开低价值的,抓高信息密度的,有眼光。
最终目标是让声音记住人,持续服务,这想法有深度且贴合需求。
平台化思路不错,用架构和AI解决定制难题,利于长期发展。
先在汽车座舱验证能力再拓展到其他消费电子,这策略能稳步推进。