中国科学家提出\”AI语言\”BabelTele:文本压缩至27.9%仍保99.5%语义

# AI终于有了自己的”母语”?中国团队BabelTele让机器说人话以外的语言
**人类读不懂,AI却秒懂——这可能是大模型时代最具颠覆性的语言学实验。**
一句话发生了什么
上海交通大学、悉尼大学、合肥工业大学、西安交通大学、南京大学的联合研究团队,在arXiv上发布了一项名为BabelTele的研究(论文编号 2606.19857)。他们发现:AI能够理解一种人类完全读不懂的”精简语言”,并基于此提出了一种将任意文本压缩至原始长度27.9% 的通信方法,语义准确性高达99.5%。
换句话说,他们给AI造了一门”外语”——人类看不懂,但模型之间用它交流不仅毫无障碍,还省下了大量Token。
这不是传统的数据压缩,而是一次**语言学层面的范式迁移**——从”让AI理解人类语言”到”让AI拥有自己的语言”。
核心数据:BabelTele到底有多强?
BabelTele压缩后的文本,融合了多语言词汇、数学符号、逻辑运算符甚至表情符号,形成一种被称为“模型原生语言”的新形态。研究团队在多项基准上进行了严格测试,结果令人震惊:
- **压缩率 72.1%**:原始文本被压缩至不足三成长度,却保留了几乎全部语义信息
- **语义准确率 99.5%**:解压后与原文的语义一致性接近完美
- **多智能体通信 Token 节省 40%**:当多个AI Agent用BabelTele交流时,任务完成度仍超过**96%**
- **跨模型零样本传递**:一个模型压缩出的BabelTele文本,另一个完全不同的模型**无需任何训练**即可直接理解
在QuALITY(长文本问答)和MeetingBank(会议摘要)等权威基准测试中,BabelTele不仅碾压了传统文本摘要方法,还全面超越了此前业界领先的LLMLingua-2压缩方案。
这相当于:你用中文写了一段话,翻译成只有AI能懂的”二进制式语言”,发给另一个AI,它不仅完全理解你的意思,还只用了不到三成的通信带宽。
人类读不懂的”天书”,AI却应对自如
研究团队设计了一个极具说服力的对比实验:让人类读者阅读BabelTele压缩后的文本,然后回答相关问题。结果显示,人类读者的问答准确率显著下降——这门”AI语言”对人而言几乎不可读。但同样是这些文本,Gemini 3.1 Pro的问答准确率保持稳定,几乎没有受到压缩带来的信息损失影响。
这揭示了一个深层次的发现:AI对信息的编码方式与人类有本质不同。人类依赖自然语言的线性语法和语义结构,而大模型能够在高度抽象的符号空间中直接”抓取”语义。BabelTele正是利用了这一点——它不是在”压缩文本”,而是在将人类语言翻译成模型的内部表征语言。
谁会从中受益?
这项技术的应用前景极为广阔,至少有四类场景会率先受益:
1. **多智能体系统**
当多个AI Agent需要协同完成复杂任务时,内部通信成本是核心瓶颈。BabelTele将Token消耗削减40%,意味着同样的计算资源可以支撑更复杂的协作网络。对于需要实时协商的自动驾驶编队、分布式金融风控系统而言,这直接转化为更快的响应速度和更低的推理成本。
2. **长文本处理**
在处理论文、法律文书、医疗记录等超长文本时,上下文窗口的Token限制是硬伤。BabelTele可以将有效上下文长度扩展近4倍,让模型在有限窗口内”看见”更多信息。这对RAG(检索增强生成)系统和长文档摘要任务意义重大。
3. **边缘设备部署**
在手机、IoT设备等算力受限场景中,每一毫秒的推理延迟和每字节的传输成本都很关键。用BabelTele压缩后的提示词和上下文,可以显著降低端侧模型的推理开销。
4. **跨语言、跨模型通信**
最令人兴奋的是零样本跨模型传递能力。一个GPT架构的模型压缩出的BabelTele文本,Claude或Gemini架构的模型可以直接理解。这意味着BabelTele有潜力成为AI世界的”通用中间语言”——不同厂商、不同架构的模型,可以用同一套”语言”高效对话。
连锁反应:AI通信协议的历史转折?
回看技术史,每一次通信协议的标准化都会催生巨大生态:HTTP统一了Web,TCP/IP统一了互联网,USB统一了外设连接。BabelTele虽然还远未达到”标准”的地位,但它指向了一种可能:模型之间需要一套独立于人类语言的通信协议。
一旦这种协议成熟,我们将看到:
- AI Agent之间不再需要将信息”翻译回人类语言”再传递,而是直接在压缩空间中交换语义
- 开源社区可能出现BabelTele的标准化实现,成为Agent框架的默认通信层
- 模型API的商业定价模式可能从”按Token计费”演变为”按语义单元计费”
当然,这条路不会一帆风顺。透明性和可解释性是最大的挑战——当AI用人类读不懂的语言交流时,我们如何审计、如何监管、如何确保安全?这些问题没有简单的答案,但BabelTele至少证明了一个基本前提:技术上,这条路是走得通的。
展望:从学术发现到基础设施
BabelTele目前仍处于学术研究阶段,从论文到落地还有相当距离。但它的核心洞见——大模型拥有独立于人类语言的语义编码能力——不会过时。随着Agent应用的爆发,模型间通信效率将成为下一代AI基础设施的争夺焦点。
中国团队在这一方向上率先做出了系统性的探索,贡献了从理论到实验的完整框架。正如深度学习的许多突破始于”让机器看见”和”让机器听懂”,BabelTele可能开启了”让机器用机器的方式对话”的新篇章。
论文链接:arXiv 2606.19857
研究机构:上海交通大学、悉尼大学、合肥工业大学、西安交通大学、南京大学
发布日期:2025年6月18日
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
