跳到正文
10月7日周三
  1. Microsoft Research22

    微软研究员 Jennifer Neville 谈 AI 的意外失败与评估边界

    微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评估如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
  1. MIT Technology Review · AI15

    将预测分析带入智能体 AI 时代

    企业 AI 的核心问题已从预测模型能否胜过统计预测,转向如何让预测系统依据自身结论自主行动而不偏离业务意图,前沿已从预测移向自主决策。深度学习与生成式 AI 驱动的智能分析支持实时训练,让 AI 持续演进而不再等待季度更新,数据源也扩展到非结构化的交互数据。Everest Group 合伙人 Vishal Gupta 表示,“分析”一词正让位于 AI。

  2. 极客公园38

    AI,为什么总在画美女?

    AI 图像生成中"美女"成为默认输出,源于模型学习数据分布时天然趋向"平均脸",而平均脸恰好符合人类审美偏好。用户点击与商业激励形成反馈循环:Civitai 上 NSFW 图片占比从 2023 年 1 月的 41% 升至 2024 年 12 月的 80%,而 PickScore 等奖励模型即便在无关提示词下也会让模型生成更多 NSFW 内容。

  3. MIT Technology Review · AI51

    为什么人们反感 AI 却又离不开它

    民调显示公众对 AI 的负面情绪上升,但使用量持续飙升,作者认为人们反感的不是技术本身,而是公司把 AI 强推给用户的方式。皮尤研究中心数据显示,美国成年人中认为 AI 对个人和社会有负面影响者多于正面者,年轻人最悲观;Gallup 5 月民调中 71% 美国成年人反对在本地新建 AI 数据中心。

10月2日周五
  1. MIT Technology Review · AI21

    MIT Technology Review 报告:以自主 AI 重新定义企业智能

    MIT Technology Review Insights 报告称,企业 AI 正从工具转向运营模式,即「agentic shift」,这要求同步重构架构与运营模式。报告援引数据称 2026 年全球 AI 投资将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。其核心发现是:企业 AI 的规模化问题是结构性的,领先者先重设计流程再选模型,数据就绪比数据量更关键。

  2. MIT Technology Review · AI50

    别被迷惑——LLM 并不会真正推理

    前 Google DeepMind 研究员指出,LLM 的思维链并非真正推理,只是同一套下一 token 预测过程的延长迭代。他列举三大缺陷:缺乏可检视的持久认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为 AI 建立可显式更新的认知状态。

10月1日周四
9月25日周五
  1. GitHub Blog · AI & ML50

    GitHub Copilot 为什么说聊天框是错的 UI

    GitHub Copilot 提出用 canvas 替代聊天框:canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信,也能调用第三方 API 或在本地执行代码。文中以 Connect 4 游戏、Winget 包管理和 SQLite 界面为例,说明让 agent 造工具比把 agent 当工具更省 token。