Google 发布 EmbeddingGemma 2 多模态嵌入模型
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Musubi 发布轻量决策模型 PolicyLM-1.7B,采用开放权重,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。Musubi 联合创始人兼首席 AI 官 Filip Jankovic 表示,这让平台管理者可以主动为内容打标。
OpenAI 宣布 GPT-6 开始向 ChatGPT 免费和 Go 用户推送,用 GPT-6 Luna 替换此前的 GPT-5.6 Luna,Plus、Pro 等付费用户则使用 GPT-6 Sol。
Anthropic 发布 Claude Haiku 5.5,官方跑分逐项超过 GPT-6 Luna,并成为新的小模型守门员。10 万 token 以内的请求输入输出价格砍 90%,超过部分砍 50%,价格对标 GPT-6 Luna 且低于 DeepSeek-V4.1 Flash。
同一新闻,精选展示《Anthropic 发布 Claude Haiku 5.5,价格较 Haiku 4.5 平均降约 75%》
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,新增名为 Intelligent UI 的功能,回答以图形、按钮、图表和表单等交互界面呈现,格式会随问题自动调整,用户还能在对话内生成储蓄计算器、小游戏等小工具。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,超过 10 万 token 则贵 5 倍。
推荐理由:Haiku 5.5 的定价与基准数据同时给出,可对照 Sonnet 5.5 与 GPT-6 Luna 判断小模型在智能体任务中的位置。
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型竞争,同时保持开放权重。该说法来自 Ars Technica 对相关消息的报道,原文未给出具体评测数据或参数细节。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称其响应更快,提供可视化内容和可直接探索、使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的视觉与交互体验。
Mistral 发布 Mistral Large 4(ML4),昵称 Le Chonk,为万亿参数开放权重模型,目前处于公开预览阶段,权重将于 10 月 27 日发布。
谷歌发布新一代旗舰模型 Gemini 4 Argon,重点面向软件工程、法律与金融等企业知识工作及网络安全防御等长周期任务。该模型在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%,输出 Token 上限从 6.4 万提升至 100 万,API 初始价格为每百万输入 Token 2 美元、输出 Token 10 美元。
推荐理由:谷歌新旗舰模型在软件工程、企业知识工作与网络安全测试中的成绩与定价一并披露,可对照其与竞品的成本性能位置。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
Google DeepMind 发布 SynthID Bio,把 SynthID 水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,在数字模型和合成出的实体蛋白质上均可验证,同时保持其生物功能。
推荐理由:SynthID 水印首次延伸到合成生物学,读者可了解其在蛋白质序列与结构上的实现方式及生物安全用途。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与工具编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成从预设音色转向可定制创作的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,读者可据此判断语音智能体的能力与成本边界。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组全部 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。
推荐理由:原文给出覆盖 90 亿个单碱基变异的预计算数据集与 AVI 评分,读者可据此判断基因组变异解读的可用入口。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,二者均以 Apache 2.0 许可开源。
Lightricks 在 GitHub 开源 LTX-2.5,称其为首个基于 DiT 的音视频基础模型,可在同一模型内实现音视频同步、高保真与多种性能模式。仓库提供 DistilledPipeline、DFRPipeline 等十余条流水线,覆盖文生视频、图生视频、音频生视频、重拍与配音等场景,模型权重约 66 GiB,需从 Hugging Face 下载。
推荐理由:原文给出 LTX-2.5 的模型清单、显存优化与多条流水线命令,读者可据此判断本地部署音视频生成的硬件门槛。