标签:多模态模型
检索墨元AI的工具、资讯和教程内容。
AI 资讯 (7)
DeepSeek V4 Flash Vision Exp 上线:API 开始原生接收图片
DeepSeek 发布实验性多模态模型 V4 Flash Vision Exp,现已通过 API 提供图像理解能力,并兼容 Chat Completions、Messages 与 Responses。本文梳理接入方式、成本边界和小团队最值得先测的场景。
Meta 发布 Muse Glimmer:30B 开放权重 Agent 模型可在单卡本地运行
Meta 发布 30B 多模态 Agent 模型 Muse Glimmer,以 Apache 2.0 许可开放权重。官方量化版可在 24GB 或 32GB 内存区间的 Mac 与单卡 PC 本地运行,重点面向工具调用、长流程任务、编程和图文理解。
MiniMax H3 发布并开放权重:15 秒 2K 原生音视频,已上线 LibTV
MiniMax 推出全模态视频生成模型 H3,可统一理解文本、图片、视频和音频,生成最长 15 秒、最高 2K、带原生双声道声音的视频。模型已上线 LibTV,开放权重也已进入 ComfyUI 原生工作流。
Kimi K3 正式开放权重:2.8 万亿参数与三项训练基础设施同步发布
月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项训练基础设施。模型总参数达 2.8 万亿,支持原生视觉理解和 100 万 Token 上下文,但 1.56 TB 的权重规模也抬高了私有部署门槛。
Black Forest Labs 发布 FLUX 3:图像、视频与原生音频进入统一模型
Black Forest Labs 推出统一训练图像、视频和音频的多模态基础模型 FLUX 3。视频版已进入申请制 Early Access,可单次生成最长 20 秒原生音频视频;图像版、动作预测版与开放权重版将分阶段推出。
阿里发布 Qwen-Image-3.0:把复杂图文生成推向可用阶段
阿里千问发布第三代图像生成基础模型 Qwen-Image-3.0,重点提升长指令、复杂版面、小字与多语言渲染能力。目前 API 仍处于邀测阶段,实际稳定性与价格有待进一步验证。
MiniMax M3 发布:百万上下文、多模态和 Agent 编程能力放到同一个模型里
MiniMax 在 2026 年 6 月 1 日发布 M3,主打前沿 Coding 与 Agent 能力、最高 1M tokens 上下文和原生多模态。模型已通过 API、Token Plan 和 MiniMax Code 开放,权重和技术报告预计在 10 天内发布。