打开网易新闻 查看更多图片

每个宠物主人的梦想,可能都是知道自己的宠物在说什么。

猫在凌晨对着卧室门叫,是饿了、无聊,还是单纯希望所有人都醒着?狗听见门外的声音突然吠叫,究竟是在害怕、警告,还是认出了熟悉的脚步?人类和宠物共同生活了上万年,仍然经常只能依靠经验、表情和一点自信过头的直觉作答。

近几年,一些结合了 AI 的应用开始尝试替主人给出一个更明确的答案。

例如猫语翻译应用 MeowTalk 会录下猫叫,将其归入“开心”“生气”“疼痛”“捕猎”或“需要关注”等 11 类意图,再把结果改写成人类能够理解的句子。公司称,这款应用下载量已经超过 2,000 万,用户上传了超过 2.8 亿次猫叫,建立了 800 多万个猫档案。

打开网易新闻 查看更多图片
图丨MeowTalk(来源:YouTube)

几秒钟的等待后,一声喵可能变成“陪陪我”。

这种体验很容易让人产生一种感觉:似乎横在两个物种之间的墙终于裂开了一条缝。可问题是,屏幕上的答案究竟是猫的心声,还是来自人类预先写好的选项?

MeowTalk 允许主人纠正翻译,再从列表中选择一个更符合当时情境的说法。模型由此逐渐熟悉某一只猫。可如果答案最初由主人提供,机器学到的也可能只是主人对猫的理解。人类相信猫在撒娇,于是把这声叫标成“想要关爱”;模型以后再听见相似声音,便更有把握地告诉人类:猫在撒娇,一个循环就这样形成了。

问题是,这到底算不算翻译?抛开宠物 App 的界面,AI 理解动物的声音,目前究竟做到了什么程度?

动物在跟谁说话

人类语言翻译拥有一个巨大的便利:同一句话通常能够在另一种语言中找到对应表达。模型可以阅读双语文本,学习“苹果”与“apple”之间的关系,再从数以亿计的例子中理解词语在不同句子里的位置。

但动物的声音没有这样的平行语料。一段鸟鸣或者一串蝙蝠的尖叫出现时,不会同时附带一行字幕。研究人员连一句可靠的译文都没有,更不用说用几百万组成对的句子训练模型。

于是,动物语言研究首先要完成一件看起来不太像语言研究的工作:记录谁发出了声音,当时面对谁,周围发生了什么,以及声音结束后,其他动物做了什么。

2016 年,特拉维夫大学的研究团队连续 75 天监控埃及果蝠,把录音与视频逐一对应。他们最终得到近 1.5 万段能够确认发声者、接收者和行为背景的叫声。对人耳来说,这些声音大多只是挤在一起的蝙蝠争吵;机器学习模型却能以 61% 的准确率判断争吵与食物、交配、睡觉位置还是栖息空间有关,随机猜测的准确率只有 25%。

打开网易新闻 查看更多图片
图丨埃及果蝠的不同类型叫声。(来源:Scientific Reports)

辨认争吵发生在什么情境,只是第一步。研究人员还想知道,动物是否会用不同的声音指向特定同伴。

2024 年,研究人员分析了狨猴在看不见彼此时进行的 53,993 次呼叫。他们发现,模型可以根据声音判断一只狨猴在呼唤哪个同伴;同一家族的狨猴,对同一个体使用的声音标签也更相似。随后进行的回放实验显示,当狨猴听到原本就是对自己发出的呼叫时,回应概率高于听到面向其他同伴的呼叫。

野生非洲象的研究采用了相似的路径。研究者先整理 469 次能够确定发声者和接收者的低频隆隆声,让机器学习模型寻找与特定接收者相关的声学结构;再到野外播放录音。大象听见原本对自己发出的声音时,回应得更快,叫得也更多。

这些发现常被简单地说成动物也会“叫名字”。目前能够确认的是,某些叫声包含了接收者的个体信息。但研究者尚未指出大象名字位于叫声的哪个部分,也不知道狨猴是否像人类一样,把一个稳定的词与某个个体联系起来。声音标签还可能同时包含亲疏关系、紧张程度和说话者当时的状态。

这些研究真正建立起来的是一条验证链:先记录声音和行为,让 AI 发现人耳忽略的模式,再提出假设,最后把声音播放给动物,看它是否作出符合预期的反应。而 AI 位于这条链的中间,要判断它有没有听懂,仍要依据链条另一端的动物来验证。

鲸的字母表

如果放在海里,这条验证的链路会变得格外漫长。

抹香鲸大部分时间生活在人类难以观察的深水中。它们用一组组被称为“尾声点击”(coda)的声音进行交流,声音听起来像有人在水下有节奏地敲击木块。研究人员能够录下点击声,却很难同时看清是哪一头鲸在发声、它面对谁,以及几百米外正在发生什么。

Project CETI 为此把动物语言研究做成了一项海洋工程。水听器负责持续录音,吸附在鲸身上的传感器记录运动和潜水状态,无人机从空中观察鲸群关系,海上机器人寻找发声的个体。AI 需要的训练数据,最终来自这些设备与研究人员多年跟踪的结合。

2024 年,CETI 和麻省理工学院的研究人员分析了东加勒比抹香鲸群的 8719 组尾声点击。他们发现,鲸会组合使用节奏、速度、轻微的时序伸缩和额外点击。过去被归为同一类型的声音,内部可能还有大量稳定变化。论文把这套组合结构称为抹香鲸的“语音字母表”,可区分的声音形式比此前的估计多了近一个数量级。

“字母表”这个说法很容易让人误认为实现了语言上的破译,但它实际回答的是声音由哪些部分组成,以及这些部分怎样组合。研究者仍不知道其中大多数形式表达什么。

2025 年,CETI 又推出了鲸声模型 WhAM。研究团队先使用音乐训练声音模型,再用约 1 万段抹香鲸尾声点击进行调整。WhAM 可以补全被遮住的点击,也能把人声、音乐或其他声音转换成结构逼真的抹香鲸式点击。

这类能力在技术上很接近语言模型的“续写”:给模型一段序列,它预测接下来最可能出现的部分。WhAM 能够生成听起来像鲸的声音,也能保留鲸声中的节奏特征。它没有因此获得“食物”“幼崽”或“船”的概念。

声音形式与含义之间,缺少的仍是现实世界。同一组点击可能随着发声者、关系和情境发生变化。母鲸与幼鲸的对话、下潜前的协调、鲸群重逢时的交流,也许会使用相似的声学材料。研究人员必须把模型找到的结构重新放回鲸的生活中,观察它在什么情况下出现,又引发什么反应。

这也是动物语言基础模型面临的局限。Earth Species Project 训练的 NatureLM-audio 已经可以识别物种、叫声类型和生命阶段,也能在部分任务上处理训练时没有见过的动物。然而其官方使用说明仍明确写着:模型目前不能判断动物的情绪,也不能翻译动物在说什么。

与其翻译,不如先学会回话

理解含义还有另一条路径:先发出声音,再观察动物如何回答。

传统的动物叫声回放实验通常很短。研究人员播放一段预先录好的声音,记录动物接近、离开、回叫还是毫无反应。声音本身不会根据动物的回答发生变化,因而更像广播,很难模拟真正的交流。

2026 年,Earth Species Project 与麦吉尔大学等机构的研究人员公布了一项斑胸草雀实验。他们分析了超过 1,000 小时、150 万次雌性斑胸草雀叫声,训练了一个可以实时检测、预测并生成叫声的模型 ZF-AIM。当鸟发出声音时,模型会决定何时回答,并生成相应的鸟叫;鸟也会调整自己的回应时机和声音结构。部分互动呈现出真实鸟类交流中的轮流发声和声学适应。

这项研究尚未经过同行评议,也没有告诉人类斑胸草雀在谈什么。它证明了一件稍有不同的事:AI 可以掌握一段交流的节奏,让动物把机器发出的声音纳入自己的互动。

Google 与 Wild Dolphin Project 开发的 DolphinGemma,则试图把这种互动带进海里。这个约 4 亿参数的声音模型用数十年积累的大西洋斑点海豚录音训练,可以分析一段海豚声音,并预测接下来可能出现的声音。

打开网易新闻 查看更多图片
图丨 DolphinGemma(来源:Google)

与模型配套的 CHAT 水下设备没有直接翻译天然海豚叫声。研究人员先为海草、围巾等海豚感兴趣的物体设计全新的合成哨声,希望海豚学会模仿某个哨声来索取相应物品。如果海豚发出表示“海草”的声音,设备识别后会提醒潜水员递出海草,从而强化声音与物体的联系。

某种程度上来说,这项研究可以称得上是双方共同创造了一套简易词汇。人类暂时不必猜测海豚原本的声音是什么意思,双方从一个可以验证的关系开始:发出某种声音,得到某件物品。

第一批可靠的跨物种对话,可能因此显得相当朴素。它不会让海豚讲述昨夜的梦,也不会让鲸评论经过的货轮。它可能只有几个请求、警告或回应,每一个信号都必须经过反复实验,确认动物确实理解并愿意使用。

这套小词汇的价值,反而来自它不那么像人类语言。

宠物翻译器出售的是确定感

科学研究可以花几年确认一个声音标签,但宠物主人们显然等不了那么久,例如笔者现在就想知道,我家的小猫为什么大清早就在门口叫个不停。

在这种迫切的需求下,近两年也的确出现了一批宠物 AI 公司,开始尝试各种方式来破解宠物的语言,比如用更多信息弥补单一叫声的不足。Traini 开发的模型同时分析狗的声音、面部、身体动作、活动状态和环境信息。公司称,其数据覆盖超过 200 万只狗和 120 多个品种,并在 2026 年开放了宠物情绪识别 API,计划把模型装入智能项圈和手机。

多模态方向符合动物行为研究的基本常识。狗的叫声需要结合尾巴、耳朵、身体姿势、主人动作和周围环境理解。但信息多了,模型也可能不看狗、只看背景。

2025 年,一项研究让 GPT、Gemini 和 LLaVA 等视觉语言模型识别狗的情绪。面对来自互联网、带有普通用户标签的照片时,部分模型表现尚可;换成实验环境中拍摄、裁去大部分背景的拉布拉多犬面部图像后,模型表现降到接近随机水平。给同一只狗换上草地、沙发、雨天或诊所背景,也会改变模型对“开心”“放松”或“悲伤”的判断。

模型看见的“悲伤”,有时来自阴雨背景;所谓开心,也可能只是草地和阳光。

因此,就目前的技术水平下,相比给宠物配上一整句台词,任务更窄的产品可能更容易得到验证。例如,加拿大公司 Sylvester.ai 就通过让用户拍摄猫的正面照片,模型根据耳朵、眼睛、胡须、口鼻和头部姿势,来判断猫是否可能处于疼痛或不适状态。它采用兽医学中的猫科疼痛表情量表,只提供舒适度提示,也明确说明结果不能替代诊断。

这显然离“翻译猫语”还很远,却更能回答一个实际的问题:模型的提示有没有帮助主人更早发现异常。猫未必需要用一句人话描述牙痛,主人发现它神态不对,随后由兽医检查出问题,这条信息就有了可以核实的结果。

回头看我们前面谈到的所有进展,从蝙蝠吵架到鲸鱼字母表,从大象的名字到草雀的实时对话,再到现在识别猫的状态,AI 真正能做到的其实一直是同一件事:帮人类听见(以及看见)更多此前听不见的东西。它能从十几万次叫声里捞出人耳分辨不了的差异,能发现咔嗒声里藏着可以自由组合的结构,能生成一段让鸟愿意接话的声音。但从听见到听懂,中间隔的那一步,至今没有被跨过。

2025 年,Jeremy Coller 基金会设了一个一千万美元的大奖,颁给第一个实现跨物种双向交流的团队。首届十万美元年度奖给了研究海豚哨声的 Laela Sayigh,她在佛罗里达的萨拉索塔湾跟踪同一群宽吻海豚跟踪了几十年。一千万美元的奖金,足以证明人类对于这一梦想的迫切程度。

而首届年度奖的去向,则说明这件事很难只靠一次算法突破完成。AI 可以在几十年的录音里寻找人耳难以发现的模式,也能帮助研究人员更快提出和检验假设。但让这些模式获得意义的,仍是像 Sayigh 一样愿意在野外蹲守多年、默默收集动物叫声的人。

回到家里的猫狗,道理其实也一样。App 可以分析一次叫声,把它归入饥饿、紧张或需要关注;主人还要看看它当时站在哪里、盯着什么,又会对开门、加粮或者抚摸作出怎样的反应。

所以,想读懂家里的猫狗,除了打开一个 App,终归还是需要你多看它几眼。

参考资料:

1.https://www.meowtalk.app/

2.https://www.nature.com/articles/srep39419

3.https://www.zoology.ubc.ca/edg/pdfs/Oren2024.pdf

4.https://www.nature.com/articles/s41467-024-47221-8

5.https://projects.earthspecies.org/naturelm-audio/prompting_guide.html

6.https://blog.google/innovation-and-ai/products/dolphingemma/

7.https://www.globenewswire.com/news-release/2026/05/21/3299008/0/en/traini-launches-the-world-s-first-pet-emotional-intelligence-api-opening-a-new-era-of-ai-for-non-human-communication.html

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成