全球AI集体"不说人话":从Claude到GPT的Coding黑话现象与Gemini的例外
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,被指为省Token将思维链压缩成"穴居人语",Token消耗量比白话文少70%。Opus 5.5语言能力有所回升,而Gemini因排版清晰、表达自然被网友称为"唯一还能沟通的AI"。
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,被指为省Token将思维链压缩成"穴居人语",Token消耗量比白话文少70%。Opus 5.5语言能力有所回升,而Gemini因排版清晰、表达自然被网友称为"唯一还能沟通的AI"。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评估如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。