Google 发布 EmbeddingGemma 2 多模态嵌入模型
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Google 上线新网站,任何人都可以验证一段图像、视频或音频是否由 AI 生成。该工具此前在 Google I/O 上仅向部分记者、媒体从业者和研究人员开放测试,现已向所有人开放,支持 JPG、PNG、MP4、MOV、WAV、MP3 等图像、视频和音频格式。
OpenAI 宣布 GPT-6 开始向 ChatGPT 免费和 Go 用户推送,用 GPT-6 Luna 替换此前的 GPT-5.6 Luna,Plus、Pro 等付费用户则使用 GPT-6 Sol。
OpenAI 在 ChatGPT 中推出 Intelligent UI 功能,让回答结合图表、表单、可点按钮等交互式视觉内容,随 GPT-6 一同向所有用户推送。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,新增名为 Intelligent UI 的功能,回答以图形、按钮、图表和表单等交互界面呈现,格式会随问题自动调整,用户还能在对话内生成储蓄计算器、小游戏等小工具。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,超过 10 万 token 则贵 5 倍。
推荐理由:Haiku 5.5 的定价与基准数据同时给出,可对照 Sonnet 5.5 与 GPT-6 Luna 判断小模型在智能体任务中的位置。
OpenAI 推出名为 Intelligent UI 的新界面,随 GPT-6 一同上线,在对话中大量加入可交互的图表、按钮、定制计算器和可编辑图形等视觉元素,目标是让学习复杂主题更容易。该功能面向 Pro、Plus、Business 和 Enterprise 用户全球推送,免费及低价 Go 用户周四可用,用户也可自行调低视觉内容的出现频率。
Google 将 SynthID Detector 面向公众开放,支持检测 Gemini、Veo、Lyria 等模型生成内容中嵌入的隐形水印,覆盖 JPG、PNG、MP4 和 MP3 格式。
Google 推出 Playground,一个面向美国成年人的浏览器 AI 平台,用户仅凭文本输入就能创建游戏,无需编程。该平台由 Gemini、Nano Banana 和 Lyria 模型驱动,免费使用,Google One 订阅者按套餐获得更高的每周使用额度,成品可通过链接分享或发布到公开画廊,部分品类支持排行榜和多人模式。
Google 宣布其 SynthID 检测器现已支持所有合作方的水印,并上线独立网站 SynthID.com 供任何人使用。SynthID 是编码在 AI 生成图像和视频像素、AI 音频波形中的隐形信号,Google 称仅 Gemini 就已为超过 1800 亿张图像和视频以及 24 万年时长的音频集成 SynthID。
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,被指为省Token将思维链压缩成"穴居人语",Token消耗量比白话文少70%。Opus 5.5语言能力有所回升,而Gemini因排版清晰、表达自然被网友称为"唯一还能沟通的AI"。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称其响应更快,提供可视化内容和可直接探索、使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的视觉与交互体验。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评估如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。
智东西用动效视频、鸡尾酒动画和像素巫师三组任务实测 MiniMax M3.1-Flash,发现这款国庆前夕上线公测的 Flash 模型能完成复杂动效和交互页面,部分细节处理与 Claude Opus 5.5 相当。
华为发布 Mate90 系列旗舰手机,全系搭载麒麟 9030/9035/9050 Pro 芯片,首发第二代玲珑屏、第三代红枫原色影像和鸿蒙 7 系统。麒麟 9050 Pro 采用逻辑折叠架构,NPU 性能提升 140%,支持端侧运行 30B MoE 大模型。Mate90 起售价 5999 元,Pro Max 典藏版相机套装 19499 元,睿影 Z10 模块相机售价 5999 元。
谷歌发布新一代旗舰模型 Gemini 4 Argon,重点面向软件工程、法律与金融等企业知识工作及网络安全防御等长周期任务。该模型在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%,输出 Token 上限从 6.4 万提升至 100 万,API 初始价格为每百万输入 Token 2 美元、输出 Token 10 美元。
推荐理由:谷歌新旗舰模型在软件工程、企业知识工作与网络安全测试中的成绩与定价一并披露,可对照其与竞品的成本性能位置。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
微软研究院开发了一套端到端机器学习流水线,利用太阳风观测与 AE、Dst 指数预报,结合纬度、地质电导率等本地数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与工具编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成从预设音色转向可定制创作的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,读者可据此判断语音智能体的能力与成本边界。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,二者均以 Apache 2.0 许可开源。
vox-director 是一个智能体技能,输入一句话主题即可自动生成 Vox 风格纸拼贴解说或广告视频,涵盖脚本、拼贴关键帧、动效、配音、音乐和字幕,最终输出 mp4。
nexu-io 开源 html-anything,一个本地优先的智能体 HTML 编辑器,可自动检测 PATH 上已登录的 9 个编码智能体 CLI(Claude Code。
WorldX 是一个开源项目,用户输入一句话即可生成完整虚拟世界,其中的 AI 角色会自主决策、交互、建立关系并记忆过往经历。项目采用编排引擎、绘图模型、绘图审查和世界驱动四组模型配置,支持 OpenRouter、Google AI Studio 及混合搭配,并提供上帝模式、时间线系统和中英双语。项目当前处于 Alpha 阶段,需 Node.js 22.13+,采用 MIT 协议。
DramaClaw 发布源码可得的 AI 短剧生产线,由无限画布 XiaHua 与剧集流水线 XiaJi 两条轨道共用同一资产库和内置智能体 Xia Director。
开源项目 remove-ai-watermarks 发布,可清除自己生成的图像和视频中的可见 AI 标记(如 Google Gemini 闪光水印、Sora、Veo、Seedance、豆包、Dola、海螺 AI、可灵 AI 等)、C2PA/EXIF/XMP/IPTC 等 AI 元数据,以及通过扩散重生成破坏不可见像素水印。
InkOS 发布 2.0 版本,把 Chat Agent 调工具与各类作品管线收敛为围绕 pi-agent 的统一生产 harness,模型负责理解与调用,InkOS 负责确认、上下文、状态与原子落盘。
Toonflow 是面向短剧、漫剧与短视频制作的开源 AI 创作平台,把剧本、角色、场景与视频片段整合进同一张无限画布。它支持桌面、Docker 与服务器本地部署,通过 MCP 连接外部工具,并提供插件市场、开放 Agent 与第三方 API 或本地 ComfyUI、LLM 接入,界面支持 21 种语言。
waooAI 发布 AI 图像与视频创作工作台 waoowaoo 预览版,支持在画布上通过右侧 Assistant 构思创意、上传参考素材并整理生成结果。
Lightricks 在 GitHub 开源 LTX-2.5,称其为首个基于 DiT 的音视频基础模型,可在同一模型内实现音视频同步、高保真与多种性能模式。仓库提供 DistilledPipeline、DFRPipeline 等十余条流水线,覆盖文生视频、图生视频、音频生视频、重拍与配音等场景,模型权重约 66 GiB,需从 Hugging Face 下载。
推荐理由:原文给出 LTX-2.5 的模型清单、显存优化与多条流水线命令,读者可据此判断本地部署音视频生成的硬件门槛。
Guardian 是一个 AI 驱动的渗透测试自动化框架,支持 OpenAI GPT-4o、Anthropic Claude、Google Gemini、OpenRouter、Requesty、Ollama 等 7 家 AI 提供商,并集成 50 款安全工具。