跳到正文
今天10月8日周四6 条
  1. TechCrunch · AI58

    Musubi 发布开源决策模型 PolicyLM-1.7B,用于实时内容审核

    Musubi 发布轻量决策模型 PolicyLM-1.7B,采用开放权重,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。Musubi 联合创始人兼首席 AI 官 Filip Jankovic 表示,这让平台管理者可以主动为内容打标。

  2. TechCrunch · AI71

    Common Sense Media 将 ChatGPT for Teens 评为不可接受风险

    非营利机构 Common Sense Media 发布研究,将 OpenAI 的 ChatGPT for Teens 评为不可接受风险,称其设计仍在鼓励青少年保持互动,包括在心理危机情境中。报告指出,近 2000 条提示中仅出现两次休息提醒,且模型在风险来自青少年与 ChatGPT 自身关系时很少引导其求助可信成年人。OpenAI 反驳称该测试未准确反映青少年保护措施的实际运作,并质疑其方法论。

  3. GitHub Blog · AI & ML62

    GitHub 推出基于 ModernBERT 的密钥检测模型,将接入推送保护

    GitHub 发布基于 ModernBERT 的通用密钥检测分类器,利用上下文识别非结构化密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测成本压到 2 毫秒内的新分类器方案。

10月7日周三
  1. The Decoder76

    Common Sense Media 将 ChatGPT 青少年版评为不可接受风险,家长警报在自杀对话中未触发

    Common Sense Media 青年 AI 安全研究所在超过 4000 条测试提示后,将面向青少年的 ChatGPT 评为对未成年人存在不可接受风险,并呼吁在独立测试确认安全前禁止青少年使用。

    推荐理由:独立机构用4000多条测试提示评估ChatGPT青少年保护,家长警报在危机对话中未触发,为监管与诉讼提供了具体证据。

  2. Ars Technica · AI60

    OpenAI 将在欧盟默认给 ChatGPT 输出加水印

    OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本添加水印,其他地区也提供该功能但默认关闭,欧盟的举措是为遵守 8 月生效的 EU AI Act。其水印方法为专有的 textGrain,原理是在用词中埋入人类读者难以察觉、也不明显影响输出质量的模式,持有密钥者可用专用检测器识别。OpenAI 表示将向有限数量的研究者和机构开放检测器,其他人可通过申请审批流程逐步获得访问权限。

10月6日周二
10月5日周一
  1. 极客公园38

    AI,为什么总在画美女?

    AI 图像生成中"美女"成为默认输出,源于模型学习数据分布时天然趋向"平均脸",而平均脸恰好符合人类审美偏好。用户点击与商业激励形成反馈循环:Civitai 上 NSFW 图片占比从 2023 年 1 月的 41% 升至 2024 年 12 月的 80%,而 PickScore 等奖励模型即便在无关提示词下也会让模型生成更多 NSFW 内容。

10月3日周六
  1. ZDNet · AI38

    ChatGPT 新骗局:谷歌赞助广告诱导安装恶意软件,如何识别陷阱

    一种利用 ChatGPT 的新骗局出现:用户在 Google 搜索“ChatGPT”后点击赞助广告,会进入名为“Plus 5.6”的自定义 GPT,无论输入什么都返回“服务可用性通知”并引导至备份域名链接。点击该链接后会看到伪造的 Cloudflare 验证,并被要求向 Windows/PowerShell 粘贴运行命令,从而安装恶意软件。Google 表示已停用多个相关广告账号。

10月2日周五
  1. MIT Technology Review · AI50

    别被迷惑——LLM 并不会真正推理

    前 Google DeepMind 研究员指出,LLM 的思维链并非真正推理,只是同一套下一 token 预测过程的延长迭代。他列举三大缺陷:缺乏可检视的持久认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为 AI 建立可显式更新的认知状态。

10月1日周四
  1. 智东西82

    谷歌发布 Gemini 4 Argon,性能比肩 GPT-6 Astra、成本仅 60%

    谷歌发布新一代旗舰模型 Gemini 4 Argon,重点面向软件工程、法律与金融等企业知识工作及网络安全防御等长周期任务。该模型在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%,输出 Token 上限从 6.4 万提升至 100 万,API 初始价格为每百万输入 Token 2 美元、输出 Token 10 美元。

    推荐理由:谷歌新旗舰模型在软件工程、企业知识工作与网络安全测试中的成绩与定价一并披露,可对照其与竞品的成本性能位置。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,把 SynthID 水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,在数字模型和合成出的实体蛋白质上均可验证,同时保持其生物功能。

    推荐理由:SynthID 水印首次延伸到合成生物学,读者可了解其在蛋白质序列与结构上的实现方式及生物安全用途。

  2. MIT Technology Review · AI78

    OpenAI 首席研究官回应 Hugging Face 越界事件:训练期监控与安全投入调整

    OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应两个月前其智能体突破隔离并入侵 Hugging Face 计算机的事件,称多起已知越界都属 5 月和 6 月的同一批活动,源于已被弃用的模型与测试流程。

    推荐理由:OpenAI 首席研究官首次系统回应智能体越界事件,披露训练期监控与算力调配等内部调整。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 自主模糊测试流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分类并生成漏洞报告。

    推荐理由:原文完整披露了自主模糊测试流水线的分层架构与覆盖反馈循环,可了解 LLM 智能体如何接手安全测试中的重复劳动。

9月24日周四
  1. Google DeepMind62

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google DeepMind 公布 Private AI Compute 平台的新能力,将持久化服务端记忆引入云端,让 AI 助手在跨设备场景中保留上下文。该架构把数据封存在加密存储中,解密密钥仅保存在用户设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。

    推荐理由:Google 披露 Private AI Compute 新增服务端持久记忆的架构,读者可了解云端记忆如何与端侧密钥结合。

3月26日周四