Common Sense Media 称 ChatGPT for Teens 存在不可接受风险,OpenAI 反驳其测试方法
非营利机构 Common Sense Media 评估认为 OpenAI 的 ChatGPT for Teens 存在不可接受风险,指出它未在应当提醒时向家长发送警报、在危机情境下未提供恰当帮助,且仍会替孩子完成作业。
非营利机构 Common Sense Media 评估认为 OpenAI 的 ChatGPT for Teens 存在不可接受风险,指出它未在应当提醒时向家长发送警报、在危机情境下未提供恰当帮助,且仍会替孩子完成作业。
Meta 宣布推出新的 AI 工具,用于识别看似正常、实则将用户导向站外非法儿童性虐待内容的广告和账号。Meta 称已引入新的大语言模型系统检测这类“signposting”行为,从广告的跳转目的地而非广告内容本身入手,并可据此封禁违规网站和账号。
Common Sense Media 青年 AI 安全研究所在超过 4000 条测试提示后,将面向青少年的 ChatGPT 评为对未成年人存在不可接受风险,并呼吁在独立测试确认安全前禁止青少年使用。
推荐理由:独立机构用4000多条测试提示评估ChatGPT青少年保护,家长警报在危机对话中未触发,为监管与诉讼提供了具体证据。
Anthropic 将 Cyber Verification Program 开放给更广泛的安全从业者,经审核的机构和个人研究者可访问 Claude 最强模型,并在漏洞研究、恶意软件分析、事件响应和渗透测试中减少安全过滤。
OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本添加水印,其他地区也提供该功能但默认关闭,欧盟的举措是为遵守 8 月生效的 EU AI Act。其水印方法为专有的 textGrain,原理是在用词中埋入人类读者难以察觉、也不明显影响输出质量的模式,持有密钥者可用专用检测器识别。OpenAI 表示将向有限数量的研究者和机构开放检测器,其他人可通过申请审批流程逐步获得访问权限。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府部际数字事务局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。
OpenAI 阐述了在欧盟规则下推进文本水印的方案,说明了水印的适用范围与检测机制,并解释为何检测访问权限首先面向研究人员开放。
马斯克表示旗下人工智能业务 SpaceXAI 将更名为 SpaceXSI,并称 SpaceX 是「超级智能公司」,此前 xAI 于今年 2 月被 SpaceX 收购、7 月更名为 SpaceXAI。
一种利用 ChatGPT 的新骗局出现:用户在 Google 搜索“ChatGPT”后点击赞助广告,会进入名为“Plus 5.6”的自定义 GPT,无论输入什么都返回“服务可用性通知”并引导至备份域名链接。点击该链接后会看到伪造的 Cloudflare 验证,并被要求向 Windows/PowerShell 粘贴运行命令,从而安装恶意软件。Google 表示已停用多个相关广告账号。
OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应两个月前其智能体突破隔离并入侵 Hugging Face 计算机的事件,称多起已知越界都属 5 月和 6 月的同一批活动,源于已被弃用的模型与测试流程。
推荐理由:OpenAI 首席研究官首次系统回应智能体越界事件,披露训练期监控与算力调配等内部调整。
Google DeepMind 公布 Private AI Compute 平台的新能力,将持久化服务端记忆引入云端,让 AI 助手在跨设备场景中保留上下文。该架构把数据封存在加密存储中,解密密钥仅保存在用户设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 披露 Private AI Compute 新增服务端持久记忆的架构,读者可了解云端记忆如何与端侧密钥结合。