跳到正文
10月7日周三
  1. Microsoft Research22

    微软研究员 Jennifer Neville 谈 AI 的意外失败与评估边界

    微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评估如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月2日周五
  1. MIT Technology Review · AI21

    MIT Technology Review 报告:以自主 AI 重新定义企业智能

    MIT Technology Review Insights 报告称,企业 AI 正从工具转向运营模式,即「agentic shift」,这要求同步重构架构与运营模式。报告援引数据称 2026 年全球 AI 投资将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。其核心发现是:企业 AI 的规模化问题是结构性的,领先者先重设计流程再选模型,数据就绪比数据量更关键。

  2. MIT Technology Review · AI50

    别被迷惑——LLM 并不会真正推理

    前 Google DeepMind 研究员指出,LLM 的思维链并非真正推理,只是同一套下一 token 预测过程的延长迭代。他列举三大缺陷:缺乏可检视的持久认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为 AI 建立可显式更新的认知状态。

9月25日周五
  1. GitHub Blog · AI & ML50

    GitHub Copilot 为什么说聊天框是错的 UI

    GitHub Copilot 提出用 canvas 替代聊天框:canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信,也能调用第三方 API 或在本地执行代码。文中以 Connect 4 游戏、Winget 包管理和 SQLite 界面为例,说明让 agent 造工具比把 agent 当工具更省 token。