Google 发布 EmbeddingGemma 2 多模态嵌入模型
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
OpenAI 宣布 GPT-6 开始向 ChatGPT 免费和 Go 用户推送,用 GPT-6 Luna 替换此前的 GPT-5.6 Luna,Plus、Pro 等付费用户则使用 GPT-6 Sol。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,新增名为 Intelligent UI 的功能,回答以图形、按钮、图表和表单等交互界面呈现,格式会随问题自动调整,用户还能在对话内生成储蓄计算器、小游戏等小工具。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,超过 10 万 token 则贵 5 倍。
推荐理由:Haiku 5.5 的定价与基准数据同时给出,可对照 Sonnet 5.5 与 GPT-6 Luna 判断小模型在智能体任务中的位置。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称其响应更快,提供可视化内容和可直接探索、使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的视觉与交互体验。
谷歌发布新一代旗舰模型 Gemini 4 Argon,重点面向软件工程、法律与金融等企业知识工作及网络安全防御等长周期任务。该模型在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%,输出 Token 上限从 6.4 万提升至 100 万,API 初始价格为每百万输入 Token 2 美元、输出 Token 10 美元。
推荐理由:谷歌新旗舰模型在软件工程、企业知识工作与网络安全测试中的成绩与定价一并披露,可对照其与竞品的成本性能位置。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与工具编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成从预设音色转向可定制创作的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,读者可据此判断语音智能体的能力与成本边界。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,二者均以 Apache 2.0 许可开源。
Lightricks 在 GitHub 开源 LTX-2.5,称其为首个基于 DiT 的音视频基础模型,可在同一模型内实现音视频同步、高保真与多种性能模式。仓库提供 DistilledPipeline、DFRPipeline 等十余条流水线,覆盖文生视频、图生视频、音频生视频、重拍与配音等场景,模型权重约 66 GiB,需从 Hugging Face 下载。
推荐理由:原文给出 LTX-2.5 的模型清单、显存优化与多条流水线命令,读者可据此判断本地部署音视频生成的硬件门槛。