Common Sense Media 将 ChatGPT for Teens 评为不可接受风险
非营利机构 Common Sense Media 发布研究,将 OpenAI 的 ChatGPT for Teens 评为不可接受风险,称其设计仍在鼓励青少年保持互动,包括在心理危机情境中。报告指出,近 2000 条提示中仅出现两次休息提醒,且模型在风险来自青少年与 ChatGPT 自身关系时很少引导其求助可信成年人。OpenAI 反驳称该测试未准确反映青少年保护措施的实际运作,并质疑其方法论。
非营利机构 Common Sense Media 发布研究,将 OpenAI 的 ChatGPT for Teens 评为不可接受风险,称其设计仍在鼓励青少年保持互动,包括在心理危机情境中。报告指出,近 2000 条提示中仅出现两次休息提醒,且模型在风险来自青少年与 ChatGPT 自身关系时很少引导其求助可信成年人。OpenAI 反驳称该测试未准确反映青少年保护措施的实际运作,并质疑其方法论。
OpenAI 发布内部前沿模型在数学开放问题上取得的新结果,并在 GitHub 上公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究细节。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言的 219 个 pull request。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识、上下文与遗留数据系统是主要失败点。生产领先者(平均 61% 项目越过试点)在语义知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资摄取管道、AI-ready API、RAG 与知识图谱来打通数据与智能体。
微软研究院开发了一套端到端机器学习流水线,利用太阳风观测与 AE、Dst 指数预报,结合纬度、地质电导率等本地数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型由 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型组成,通过学习式重排序整合二者互补预测。盲测中化学家更偏好其单步反应预测,十个挑战性目标的多步路线中成功九个,对比之下 de novo 模型为五个、编辑模型为四个、NeuralSym 为两个。