跳到正文

内容方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

8 条精选近 30 天 7 条共收录 32 条

更新

多模态的精选

今天10月8日周四第 1–8 条
10月7日周三
10月1日周四
  1. 智东西82

    谷歌发布 Gemini 4 Argon,性能比肩 GPT-6 Astra、成本仅 60%

    谷歌发布新一代旗舰模型 Gemini 4 Argon,重点面向软件工程、法律与金融等企业知识工作及网络安全防御等长周期任务。该模型在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%,输出 Token 上限从 6.4 万提升至 100 万,API 初始价格为每百万输入 Token 2 美元、输出 Token 10 美元。

    推荐理由:谷歌新旗舰模型在软件工程、企业知识工作与网络安全测试中的成绩与定价一并披露,可对照其与竞品的成本性能位置。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:Gemini 4 Argon 的发布信息包含输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。

9月29日周二
  1. Microsoft Research62

    微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与工具编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成从预设音色转向可定制创作的变化。

9月16日周三
1月3日周六
  1. GitHub 热门 AIGC 开源项目83

    Lightricks 开源音视频生成模型 LTX-2.5 并发布完整推理流水线

    Lightricks 在 GitHub 开源 LTX-2.5,称其为首个基于 DiT 的音视频基础模型,可在同一模型内实现音视频同步、高保真与多种性能模式。仓库提供 DistilledPipeline、DFRPipeline 等十余条流水线,覆盖文生视频、图生视频、音频生视频、重拍与配音等场景,模型权重约 66 GiB,需从 Hugging Face 下载。

    推荐理由:原文给出 LTX-2.5 的模型清单、显存优化与多条流水线命令,读者可据此判断本地部署音视频生成的硬件门槛。