Grok 4.5 首发评测:推理追平 GPT-5.5,但 54% 幻觉率敲响警钟
Grok 4.5 首发评测:推理追平 GPT-5.5,但 54% 幻觉率敲响警钟
xAI 旗下的 Grok 4.5 于本周正式上线,独立评测平台 Artificial Analysis 第一时间给出了完整跑分。先看最受关注的 Intelligence Index 综合智能评分:54 分,排名第四,排在 Claude Fable 5(第一)、GPT-5.5(第二)和 Claude Opus 4.8(第三)之后。

这个成绩对一款从「推特嘴替」转型为严肃 AI 的产品来说,已经相当能打。
在 Coding Agent Index 上,Grok 4.5 搭配 Grok Build 得分为 76 分,与 GPT-5.5 配合 Codex 的成绩持平,仅落后于 Claude Fable 5。对于日常编程辅助来说,这意味着 Grok 4.5 已经进入第一梯队。
**关键数据:** 推理能力接近旗舰,但幻觉率从上一代的 25% 飙升至 54%,翻了一倍还多。
然而,这组亮眼数据背后藏着一颗定时炸弹。Grok 4.3 的幻觉率是 25%,而 4.5 直接翻倍到 54%。这意味着每两次回答中就有一次可能包含不实信息——对于需要高可靠性的企业应用场景,这个数字是致命的。
为什么推理能力提升了,幻觉反而更严重?行业内有一个尚未被充分讨论的解释:更强大的推理能力让模型更「自信」,但这种自信有时建立在虚构的逻辑链上。模型学会了编织看起来合理但实际错误的论证,而这恰恰是高幻觉率的温床。
成本方面,Grok 4.5 的 token 效率有显著提升。在 agentic workloads 场景下,其成本结构相比前代更加友好。结合 xAI 近期获得的大规模算力投资,Grok 正在走一条「性价比路线」——不追求全面超越,而是在关键指标上追平、在价格上拉开差距。
对于开发者来说,Grok 4.5 是一个值得关注的选项。但如果你是做医疗、金融等容错率极低的行业应用,建议至少在幻觉率回到 30% 以下之前保持观望。
在 AI 模型军备竞赛中,跑分只是入场券。谁能先把幻觉率控制住,谁才能真正赢得企业市场。
对于已经在使用 Grok 的开发者来说,当前版本的定位更像一个「多功能 AI 助手」——它既能写代码,也能做数据分析,还能在 X 平台上实时搜索最新信息。这种跨场景能力是纯代码模型或纯对话模型不具备的。但正因如此,Grok 4.5 的「广度优先」策略也与 Anthropic 和 OpenAI 的「深度优先」形成鲜明对比。
未来几个月的看点在于:xAI 能否在下一次迭代中将幻觉率显著压低。考虑到 xAI 拥有 X 平台的海量实时数据作为训练素材,如果能在事实准确性上追平对手,Grok 的性价比优势将变得非常有竞争力。
对于普通用户来说,Grok 4.5 已经足够胜任日常写作、翻译、代码调试和知识问答。只要记住一条原则:重要事实类问题,多问一次、交叉验证。这不是 Grok 特有的问题,而是当前所有大模型的共同局限。
从定价来看,xAI 采取了典型的「后发者」策略:在性能上追平一线梯队,在定价上保持优势。Grok 当前的价格约为 GPT-5.5 的 60-70%,考虑到它的综合智能排名第四且具备实时 X 平台搜索能力,这个性价比相当有竞争力。如果企业用户能在幻觉率和可靠性之间找到平衡点,Grok 4.5 可能是一个被低估的生产力工具。
🔥 关注LC智趣厅,不错过每一次AI前沿解读
👇 关注不错过
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
