中国科学家提出\”AI语言\”BabelTele:文本压缩至27.9%仍保99.5%语义

· 科技资讯
中国科学家提出\

# AI终于有了自己的”母语”?中国团队BabelTele让机器说人话以外的语言

**人类读不懂,AI却秒懂——这可能是大模型时代最具颠覆性的语言学实验。**

一句话发生了什么

上海交通大学、悉尼大学、合肥工业大学、西安交通大学、南京大学的联合研究团队,在arXiv上发布了一项名为BabelTele的研究(论文编号 2606.19857)。他们发现:AI能够理解一种人类完全读不懂的”精简语言”,并基于此提出了一种将任意文本压缩至原始长度27.9% 的通信方法,语义准确性高达99.5%

换句话说,他们给AI造了一门”外语”——人类看不懂,但模型之间用它交流不仅毫无障碍,还省下了大量Token。

这不是传统的数据压缩,而是一次**语言学层面的范式迁移**——从”让AI理解人类语言”到”让AI拥有自己的语言”。

核心数据:BabelTele到底有多强?

BabelTele压缩后的文本,融合了多语言词汇、数学符号、逻辑运算符甚至表情符号,形成一种被称为“模型原生语言”的新形态。研究团队在多项基准上进行了严格测试,结果令人震惊:

  • **压缩率 72.1%**:原始文本被压缩至不足三成长度,却保留了几乎全部语义信息
  • **语义准确率 99.5%**:解压后与原文的语义一致性接近完美
  • **多智能体通信 Token 节省 40%**:当多个AI Agent用BabelTele交流时,任务完成度仍超过**96%**
  • **跨模型零样本传递**:一个模型压缩出的BabelTele文本,另一个完全不同的模型**无需任何训练**即可直接理解

QuALITY(长文本问答)和MeetingBank(会议摘要)等权威基准测试中,BabelTele不仅碾压了传统文本摘要方法,还全面超越了此前业界领先的LLMLingua-2压缩方案。

这相当于:你用中文写了一段话,翻译成只有AI能懂的”二进制式语言”,发给另一个AI,它不仅完全理解你的意思,还只用了不到三成的通信带宽。

人类读不懂的”天书”,AI却应对自如

研究团队设计了一个极具说服力的对比实验:让人类读者阅读BabelTele压缩后的文本,然后回答相关问题。结果显示,人类读者的问答准确率显著下降——这门”AI语言”对人而言几乎不可读。但同样是这些文本,Gemini 3.1 Pro的问答准确率保持稳定,几乎没有受到压缩带来的信息损失影响。

这揭示了一个深层次的发现:AI对信息的编码方式与人类有本质不同。人类依赖自然语言的线性语法和语义结构,而大模型能够在高度抽象的符号空间中直接”抓取”语义。BabelTele正是利用了这一点——它不是在”压缩文本”,而是在将人类语言翻译成模型的内部表征语言

谁会从中受益?

这项技术的应用前景极为广阔,至少有四类场景会率先受益:

1. **多智能体系统**

当多个AI Agent需要协同完成复杂任务时,内部通信成本是核心瓶颈。BabelTele将Token消耗削减40%,意味着同样的计算资源可以支撑更复杂的协作网络。对于需要实时协商的自动驾驶编队、分布式金融风控系统而言,这直接转化为更快的响应速度和更低的推理成本。

2. **长文本处理**

在处理论文、法律文书、医疗记录等超长文本时,上下文窗口的Token限制是硬伤。BabelTele可以将有效上下文长度扩展近4倍,让模型在有限窗口内”看见”更多信息。这对RAG(检索增强生成)系统和长文档摘要任务意义重大。

3. **边缘设备部署**

在手机、IoT设备等算力受限场景中,每一毫秒的推理延迟和每字节的传输成本都很关键。用BabelTele压缩后的提示词和上下文,可以显著降低端侧模型的推理开销。

4. **跨语言、跨模型通信**

最令人兴奋的是零样本跨模型传递能力。一个GPT架构的模型压缩出的BabelTele文本,Claude或Gemini架构的模型可以直接理解。这意味着BabelTele有潜力成为AI世界的”通用中间语言”——不同厂商、不同架构的模型,可以用同一套”语言”高效对话。

连锁反应:AI通信协议的历史转折?

回看技术史,每一次通信协议的标准化都会催生巨大生态:HTTP统一了Web,TCP/IP统一了互联网,USB统一了外设连接。BabelTele虽然还远未达到”标准”的地位,但它指向了一种可能:模型之间需要一套独立于人类语言的通信协议

一旦这种协议成熟,我们将看到:

  • AI Agent之间不再需要将信息”翻译回人类语言”再传递,而是直接在压缩空间中交换语义
  • 开源社区可能出现BabelTele的标准化实现,成为Agent框架的默认通信层
  • 模型API的商业定价模式可能从”按Token计费”演变为”按语义单元计费”

当然,这条路不会一帆风顺。透明性和可解释性是最大的挑战——当AI用人类读不懂的语言交流时,我们如何审计、如何监管、如何确保安全?这些问题没有简单的答案,但BabelTele至少证明了一个基本前提:技术上,这条路是走得通的

展望:从学术发现到基础设施

BabelTele目前仍处于学术研究阶段,从论文到落地还有相当距离。但它的核心洞见——大模型拥有独立于人类语言的语义编码能力——不会过时。随着Agent应用的爆发,模型间通信效率将成为下一代AI基础设施的争夺焦点。

中国团队在这一方向上率先做出了系统性的探索,贡献了从理论到实验的完整框架。正如深度学习的许多突破始于”让机器看见”和”让机器听懂”,BabelTele可能开启了”让机器用机器的方式对话”的新篇章。


论文链接:arXiv 2606.19857

研究机构:上海交通大学、悉尼大学、合肥工业大学、西安交通大学、南京大学

发布日期:2025年6月18日

— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅