Mirror Particle 正在构建人类行为的“世界模型”
旧金山初创公司 Mirror Particle 正在从零构建一个模拟人类行为及其变化原因的世界模型,认为依赖 LLM 角色扮演预测人群行为的方式根本行不通。该模型结合客户数据、时事、流行文化和社交媒体等专有数据,聚焦人们实际做出的“显露行为”而非问卷自述,并给出行为背后的动机与约束。
旧金山初创公司 Mirror Particle 正在从零构建一个模拟人类行为及其变化原因的世界模型,认为依赖 LLM 角色扮演预测人群行为的方式根本行不通。该模型结合客户数据、时事、流行文化和社交媒体等专有数据,聚焦人们实际做出的“显露行为”而非问卷自述,并给出行为背后的动机与约束。
OpenAI 在 GitHub 上发布了由内部前沿模型生成的 372 条数学结果,每条都声称解决了一个开放问题或取得实质进展,其中包含对重要计算机算法的改进以及与黎曼猜想相关的推进。
同一新闻,精选展示《OpenAI 公布前沿模型在数学开放问题上的新结果》
OpenAI 发布 722 篇手稿,覆盖 372 个结果族,据 AGMAI 称其中包含对“数百个”开放问题的解答,这些结果由一个未发布的前沿模型产出。OpenAI 称“平均结果”消耗相当于 ChatGPT Pro 三小时的思考算力,并公开了部分推理摘要、算力估算和尝试问题数量等细节。
OpenAI 公开 722 篇数学手稿,归为 372 组结果,全部出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。手稿涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等,OpenAI 称模型共尝试约 4000 个研究问题,平均每项结果算力约相当于 ChatGPT Pro 思考 3 小时。
推荐理由:OpenAI 一次性公开 722 篇数学手稿,读者可据此了解这批成果覆盖的猜想范围与数学界的核验争议。
扎克伯格与 Priscilla Chan 支持的公益机构 Biohub 正协调一项 18 亿美元的计划,覆盖数据、实验室设备和算力,目标是让 AI 模型学会预测细胞行为以加速药物研发。
微软研究院开源 Agent Lightning v1.0,用约 3500 行代码实现完整的 Harnessed Agentic RL 控制平面,让部署时使用的 agent harness 直接参与强化学习训练。
推荐理由:微软研究院开源 Agent Lightning v1.0,读者可了解让部署用 harness 直接参与 RL 训练的思路与实测增益。
Google DeepMind、Meta 和 AI 药物发现初创公司 Isomorphic Labs 联合向 Biohub 的虚拟细胞项目投资 3 亿美元,该项目属于总额 18 亿美元的 Virtual Biology 计划,用于构建可让研究人员以数字化方式提出、预测和回答生物学问题的 AI 数据集。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放完整微调流程。
OpenAI 发布内部前沿模型在数学开放问题上取得的新结果,并在 GitHub 上公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可了解其研究细节。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识、上下文与遗留数据系统是主要失败点。生产领先者(平均 61% 项目越过试点)在语义知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资摄取管道、AI-ready API、RAG 与知识图谱来打通数据与智能体。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划全流程。iSono Health 的 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已获 FDA 许可,用于自动评估乳腺密度。
NVIDIA 提出 AI 工厂投资回报由产出能力、使用寿命和需求三要素决定,其平台以高产出、长寿命、通用性应对。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
微软研究院开发了一套端到端机器学习流水线,利用太阳风观测与 AE、Dst 指数预报,结合纬度、地质电导率等本地数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。
Google DeepMind 发布 SynthID Bio,把 SynthID 水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,在数字模型和合成出的实体蛋白质上均可验证,同时保持其生物功能。
推荐理由:SynthID 水印首次延伸到合成生物学,读者可了解其在蛋白质序列与结构上的实现方式及生物安全用途。
针对 2.8 万亿参数、104B 激活参数的开源模型 Kimi K3,浪潮信息与海外团队 Inferact 几乎同时给出推理优化方案。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与工具编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型由 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型组成,通过学习式重排序整合二者互补预测。盲测中化学家更偏好其单步反应预测,十个挑战性目标的多步路线中成功九个,对比之下 de novo 模型为五个、编辑模型为四个、NeuralSym 为两个。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组全部 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。
推荐理由:原文给出覆盖 90 亿个单碱基变异的预计算数据集与 AVI 评分,读者可据此判断基因组变异解读的可用入口。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,二者均以 Apache 2.0 许可开源。
MiniOneRec 是首个全开源生成式推荐框架,提供从 SID 构建、监督微调(SFT)到基于 GRPO 的推荐导向强化学习的端到端流程。它通过三级 RQ-VAE 将商品标题与描述量化为语义 SID,并在 RL 阶段采用约束束搜索保证推荐结果唯一有效。项目已支持 Amazon18 与 Amazon23 数据集,并可直接下载模型 checkpoint。