标签:多模态模型

检索墨元AI的工具、资讯和教程内容。

热门标签AI AgentAI视频生成AI 编程AI编程工具AI图像生成DeepSeekAI智能体AI聊天助手多模态模型AI办公工具AI设计AI写作工具

AI 资讯 (7)

DeepSeek V4 Flash Vision Exp 视觉 API 主题画面,智能体正在分析图表并连接图像输入与工具调用
模型动态

DeepSeek V4 Flash Vision Exp 上线:API 开始原生接收图片

DeepSeek 发布实验性多模态模型 V4 Flash Vision Exp,现已通过 API 提供图像理解能力,并兼容 Chat Completions、Messages 与 Responses。本文梳理接入方式、成本边界和小团队最值得先测的场景。

笔记本电脑本地运行 Muse Glimmer 并连接图像、图表、代码与工具的 Agent 场景
模型动态

Meta 发布 Muse Glimmer:30B 开放权重 Agent 模型可在单卡本地运行

Meta 发布 30B 多模态 Agent 模型 Muse Glimmer,以 Apache 2.0 许可开放权重。官方量化版可在 24GB 或 32GB 内存区间的 Mac 与单卡 PC 本地运行,重点面向工具调用、长流程任务、编程和图文理解。

电影画面与蓝金双色声波同步生成,周围悬浮图片和音频参考素材
模型动态

MiniMax H3 发布并开放权重:15 秒 2K 原生音视频,已上线 LibTV

MiniMax 推出全模态视频生成模型 H3,可统一理解文本、图片、视频和音频,生成最长 15 秒、最高 2K、带原生双声道声音的视频。模型已上线 LibTV,开放权重也已进入 ComfyUI 原生工作流。

月牙光环前开启的模型权重资料库与中央 K3 核心,前方陈列三组技术基座
模型动态

Kimi K3 正式开放权重:2.8 万亿参数与三项训练基础设施同步发布

月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项训练基础设施。模型总参数达 2.8 万亿,支持原生视觉理解和 100 万 Token 上下文,但 1.56 TB 的权重规模也抬高了私有部署门槛。

FLUX 3 黑色多模态核心连接静态影像、视频画面与金色音频波形
模型动态

Black Forest Labs 发布 FLUX 3:图像、视频与原生音频进入统一模型

Black Forest Labs 推出统一训练图像、视频和音频的多模态基础模型 FLUX 3。视频版已进入申请制 Early Access,可单次生成最长 20 秒原生音频视频;图像版、动作预测版与开放权重版将分阶段推出。

Qwen-Image-3.0 复杂图文生成能力展示,画面包含多语言文字、公式、图表与分区版面
模型动态

阿里发布 Qwen-Image-3.0:把复杂图文生成推向可用阶段

阿里千问发布第三代图像生成基础模型 Qwen-Image-3.0,重点提升长指令、复杂版面、小字与多语言渲染能力。目前 API 仍处于邀测阶段,实际稳定性与价格有待进一步验证。

MiniMax M3 长上下文多模态 Agent 工作流示意图
模型动态

MiniMax M3 发布:百万上下文、多模态和 Agent 编程能力放到同一个模型里

MiniMax 在 2026 年 6 月 1 日发布 M3,主打前沿 Coding 与 Agent 能力、最高 1M tokens 上下文和原生多模态。模型已通过 API、Token Plan 和 MiniMax Code 开放,权重和技术报告预计在 10 天内发布。