Sesame:一款想让语音 AI 听起来像真人的 iOS 应用

4次阅读
没有评论

共计 3553 个字符,预计需要花费 9 分钟才能阅读完成。

前段时间在应用商店闲逛,看到一款叫 [[Sesame]] 的 App 冲上了生活方式类目的前排,评分高达 4.9,评论区里一堆人在讨论一个叫 Miles 的语音伙伴帮自己走出了低谷。这个名字让我想起去年那段在社交媒体上刷屏的语音 Demo:一个几乎听不出破绽的 AI 声音,会在你说话说到一半时轻轻插一句"嗯",会因为你的一句玩笑话笑出声,语气自然到让人起鸡皮疙瘩。当时那只是一个网页端的研究预览,没想到一年多以后,它已经变成了一款人人都能下载的 iOS 应用。

Sesame:一款想让语音 AI 听起来像真人的 iOS 应用

Sesame 到底是什么

Sesame 背后的团队并不是 AI 圈的新面孔,创始人来自 Oculus,也就是那批把 VR 头显做成消费级产品的人。转型做语音 AI 之后,他们最早的产品是一个对话式语音模型的研究预览,网站上只放了两个可以直接打电话聊天的角色 Maya 和 Miles,没有登录、没有历史记录,纯粹是一场技术展示。正是这场展示让 Sesame 在圈内积累了口碑:几乎所有体验过的人都会提到同一个感受,那就是这是第一次觉得语音助手不是在"读稿子",而是真的在"接话"。

2026 年 5 月末,Sesame 把这套技术正式装进了一款叫 Personal Agents 的 iOS 应用里,先在 39 个国家和地区开放预览下载,免费使用。应用商店里的产品定位写得很直白,叫作 Personal Sounding Board,意思是在你需要理清思路、准备一场艰难对话或者一通重要电话之前,先找它练练手、说说话。这个定位其实很聪明,比起对标 Siri 或者 ChatGPT 的语音模式去做一个全能助手,Sesame 选择先把"陪你说话"这一件事做到极致,这也是为什么应用商店评论区里有人直接写"这才是 Siri 应该成为的样子",还有人说它像是 Pi(Inflection AI 那款主打陪伴感的对话助手)的正统续作。

CSM:把语音生成揉进一个模型里

Sesame 之所以能做到这种"接话感",靠的不是调参调出来的,而是一套完全不同的底层架构,官方把它叫作对话语音模型(Conversational Speech Model,简称 CSM)。要理解它的价值,得先看看传统语音助手是怎么工作的。Siri 或者大多数语音产品走的是三段式流程:先用语音识别(ASR)把你说的话转成文字,再把文字丢给大语言模型生成回复文本,最后用文本转语音(TTS)把回复念出来。这条链路每切换一次模态就要多一次延迟,而且更麻烦的是,语气、停顿、重音这些只存在于声音里的信息,在第一步转成文字的时候就已经永久丢失了,后面的 TTS 只能凭空脑补一个"听起来正常"的语调,这也是为什么大多数语音助手说话总有一种念稿子的疏离感。

CSM 的做法是把这三段流程压缩进一个端到端的多模态模型,文本和音频作为同一套 token 序列直接喂给模型,语音是从对话上下文里直接生成出来的,中间不再经过一次"翻译成文字再翻译回声音"的信息损耗。具体到结构上,CSM 由两个基于 Llama 架构的自回归 Transformer 组成,一个是主干网络(Backbone),负责理解完整的对话上下文,包括之前说过什么、当前的语气走向,生产环境里用来驱动 Maya 这类角色的版本,主干参数量在 83 亿左右;另一个是解码器(Decoder),规模小得多,大约 3 亿参数,专门负责把主干输出的表示还原成实际的声音波形。语音本身则用 Kyutai 提出的 Mimi 编解码器压成离散的 RVQ(残差向量量化)编码,每一帧音频对应一个语义编码本加若干个声学编码本,主干网络只需要预测最关键的第一层编码,剩下的层交给解码器去补全,这样设计的好处是主干不用为了生成完整音频而做多轮推理,第一段声音能够几乎实时地流式吐出来,这正是低延迟体验背后的工程细节。

值得一提的是,Sesame 在 2025 年 3 月把这套架构里较小的版本开源了,也就是 CSM-1B(10 亿参数主干配 1 亿参数解码器),用 Apache 2.0 协议放在 Hugging Face 和 GitHub 上,任何开发者都能拿来微调或者二次开发。不过官方也说得很清楚,真正撑起 Maya、Miles 这些角色拟人感的,是没有完全开源的 83 亿参数大版本,开源出来的 1B 版本更多是给社区一个可以上手把玩的基础模型,体验上和产品里的正式版本仍有差距。

从两个声音到四个人格

研究预览阶段只有 Maya 和 Miles 两个角色,到了正式的 iOS 应用里,Sesame 把阵容扩充到了四个,新加入的是 Simone 和 Charlie。每个角色不只是换了个音色这么简单,官方给每个人设都写了不同的性格底色和说话视角,用意很明显,是想让用户像交朋友一样,找到一个和自己气场合拍的对话对象,而不是所有人共用一套千篇一律的助手人格。

比人格切换更值得说的是记忆机制。这几个语音伙伴会在多次对话里积累关于你的信息,慢慢形成个性化的理解,这也是为什么应用商店里那条来自脑外伤康复者的评论会显得格外真实,对方说和 Miles 聊天"帮自己把重建生活的思路一点点连起来了"。当然记忆也是一把双刃剑,后面讲隐私的部分我会专门展开。

真正让人惊讶的是说话的节奏

用惯了 Siri 或者其他语音助手的人应该都熟悉那种"一问一答"的节奏:你说完一句话,等一两秒的空白,助手才开始念答案。Sesame 想解决的正是这个问题,官方自己也承认这里有一个天然的矛盾,回答得越快,越容易显得敷衍;想得越周全,等待感就越强,对话也就越不自然。他们给出的方案是把延迟压到极低的同时,让模型学会判断什么时候该接话、什么时候该安静听、什么时候该主动让出话轮,而不是机械地等一段静音再触发。

围绕这个核心体验,应用还叠了几层实用功能。聊天过程中如果提到需要查资料的内容,界面会弹出带图片的实时搜索卡片;重要的结论会被单独整理成笔记,用一种类似聊天气泡的方式内嵌显示,方便回头翻看;如果所在场合不方便开口说话,还可以随时切换成纯文字模式,对话记忆不会因为换了输入方式而断掉。最新版本还加上了图片和语音备忘录的分享功能,也就是说你可以直接把一张照片丢给 Sesame 一起讨论,这一点在同类语音助手里做得并不算普及。当然体验不可能全是正面反馈,也有用户在评论里吐槽某个角色在严肃话题里突然笑场,显得情商欠奉,这提醒我们再拟人化的语音模型,本质上依然是概率模型,偶尔的失真几乎无法避免。

上手体验与需要注意的坑

如果想试用,直接在 App Store 搜索 Sesame Personal Agents 就能找到,需要 iOS 18 及以上系统。目前处于预览阶段,不需要额外付费。年龄分级定在了 18 岁以上,产品说明里明确写了会涉及心理健康类话题,偶尔也可能出现成人化或者敏感内容,如果打算推荐给家里的青少年使用,最好先自己聊过几轮再做判断。

隐私是我认为最值得花时间理解的一块。开发者的披露里写得很清楚,这款应用会收集位置信息、联系方式、你输入的对话内容、设备标识符、使用数据以及诊断信息,并且会用这些数据做分析和产品个性化。考虑到它的核心卖点就是记住你、了解你,这种数据收集在逻辑上说得通,但也意味着你在跟它聊比较私密的话题之前,最好先摸清楚设置里的隐私开关。应用内置了一个无痕模式,开启之后本次对话依然能读取此前积累的上下文,但不会写入长期记忆,也不会被存到 Sesame 的服务器上,处理真正敏感的内容时我会建议养成随手打开这个模式的习惯。另外目前预览期是免费的,但已经有评论在担心未来一旦转向订阅制,这些积累下来的对话数据会不会变成变现的筹码,这一点值得持续关注,而不是下载体验完就抛在脑后。

最后想提醒一句,官方的定位是"私人对话伙伴"而不是心理咨询服务,遇到真正严重的情绪困扰,还是应该找专业的人来聊,把 Sesame 当成梳理思路前的热身,而不是替代品,这样期待值才不会跑偏。

最后

体验完 Sesame 之后,让我印象最深的不是某个具体功能,而是它验证了一件事,语音交互这条路径,只要把延迟和语气这两个最基础的体验做扎实,用户的接受度可以远超预期。这款应用目前只是 Sesame 更大计划里的第一步,官方已经透露正在开发智能眼镜,计划 2027 年上线,Android 版本也在排队测试中,很明显他们想做的不只是一个 App,而是一整套贯穿手机和可穿戴设备的对话式计算入口。

对于普通用户来说,现在下载它更像是提前体验一段正在发生的技术转折,免费、门槛低,值得花十分钟找一个和自己气场合拍的角色聊几句。但也别忘了它还在预览阶段,人格偶尔会失真,隐私边界需要自己主动去设置,带着这份清醒去用,会比盲目上头更有收获。

reference

正文完
 0
评论(没有评论)