跳转到主要内容
查看详情

不用记,能查就行

AI 模型中心

39 家厂商的模型能力、开源状态与计价方式,可按国内/国外筛选,每条都附官方来源可一键核对。

纯静态数据,不调用任何外部接口。

厂商归属
开源状态
多模态

39 / 39 条 · 数据整理于 2026-09

  • OpenAI

    GPT-6 Astra / GPT-6.1 Sol / GPT-6 Luna

    国外开源与闭源并存多模态

    GPT-6 Astra 面向最高难度任务,GPT-6.1 Sol 以更低成本接近 Astra,GPT-6 Luna 主打高并发低成本,三者上下文约 105 万 token;图像模型 GPT Image 2.5(2026-09);另有 gpt-oss-120b / 20b 开放权重(Apache 2.0)。

  • Anthropic

    Claude Fable 5.1 / Opus 5.5 / Sonnet 5.5 / Haiku 4.5

    国外闭源多模态

    Fable 5.1 面向高难度推理与长程 Agent,Opus 5.5 面向长时编程与知识工作,Sonnet 5.5 兼顾速度与智能,Haiku 4.5 最快;前三者上下文 100 万 token、最大输出 12.8 万 token。

  • Google

    Gemini 3.8 Flash / Gemini 3.1 Pro / Gemma 4

    国外开源与闭源并存多模态

    Gemini 3.8 Flash 为最新稳定版(长程软件工程),Gemini 3.1 Pro 为预览版高阶推理模型;图像 Nano Banana 2 / Pro,视频 Gemini Omni Flash(预览);开放模型 Gemma 4(2026-04,Apache 2.0,E2B 至 31B)。

  • Meta

    Muse Spark 1.3 / Muse Glimmer

    国外开源与闭源并存多模态

    2026 年 4 月起由 Meta 超级智能实验室的 Muse 系列取代 Llama:Muse Spark 为闭源旗舰(理解视频、图像与文档,面向 Agent 与编程);Muse Glimmer 为 30B 开放权重模型(Apache 2.0),可在 Mac 或单张消费级显卡上本地运行 Agent。Llama 系列停在 Llama 4。

  • Mistral AI

    Mistral Medium 3.5 / Small 4 / Large 3

    国外开源与闭源并存多模态

    Medium 3.5 为 128B 稠密开放权重旗舰(修改版 MIT,25.6 万上下文,面向长程编程);Small 4 融合推理、多模态与编程(Apache 2.0);Large 3 为 675B MoE(Apache 2.0);另有 Codestral、Voxtral 语音与 OCR 4。

  • SpaceXAI(原 xAI)

    Grok 4.7

    国外闭源多模态

    xAI 于 2026 年 2 月被 SpaceX 收购、7 月更名 SpaceXAI。Grok 4.7 支持文本与图像输入、四档推理强度,上下文 50 万 token;Grok 4.3 / 4.20 系列上下文 100 万 token;深度接入 X 平台。

  • 深度求索

    DeepSeek-V4-Pro / DeepSeek-V4.1-Flash

    国内开源

    V4 系列:DeepSeek-V4-Pro-0813 与 V4.1-Flash 上下文均为 100 万 token、最大输出 38.4 万;V4 权重以 MIT 协议在 Hugging Face 开源,可商用。

  • 阿里云

    Qwen3.8-Max / Qwen3.7-Plus / Qwen3.8-Flash

    国内开源与闭源并存多模态

    商用旗舰 qwen3.8-max、均衡款 qwen3.7-plus、轻量 qwen3.8-flash,经阿里云百炼提供;开源 Qwen3.6 系列(如 Qwen3.6-35B-A3B,Apache 2.0)。

  • 月之暗面

    Kimi K3 / Kimi K2.7-Code

    国内开源多模态

    Kimi K3(2026-07-16)为 2.8 万亿参数 MoE,原生视觉、100 万上下文,权重以 Kimi K3 许可证开源;编程专用 kimi-k2.7-code(25.6 万上下文)。开放平台已迁至 platform.kimi.com。

  • 智谱AI

    GLM-5.3 / GLM-5.3-Flash

    国内开源多模态

    GLM-5(2026-02,744B MoE)起以 MIT 协议开源;最新 GLM-5.3 主打前沿编程并接入 GLM Coding Plan(官方称权重在发布两周后开源);GLM-5.3-Flash(320B-A18B)为该系列首个原生多模态模型,已开源,价格为 GLM-5.3 的 1/10。

  • 百度

    文心 5.1 / 文心 5.0

    国内开源与闭源并存多模态

    文心 5.0(2026-01-22 正式版)为 2.4 万亿参数原生全模态模型,统一文本、图像、视频与音频;文心 5.1(2026-05)把总参数压缩到约三分之一,Agent、推理与创作能力全面升级。

  • 字节跳动

    豆包 Seed 2.x / Seed-Evolving

    国内闭源多模态

    豆包大模型 2.0 系列(Seed 2.0 Pro / Code / lite,lite 已升级为全模态理解);Seed-Evolving 为周级持续迭代的模型,支持 100 万上下文;视频生成 Seedance 2.0。均经火山方舟提供 API。

  • 腾讯

    混元 Hy4 Preview / Hy3

    国内开源与闭源并存多模态

    混元品牌改称 Hy:旗舰 Hy4 Preview(2026-08-28,总参数 770B、激活 49B,100 万上下文);Hy3(2026-07 正式版,295B / 21B,25.6 万上下文,Preview 版已开源);另有 Hy-MT2 翻译模型。

  • MiniMax

    MiniMax M3 / MiniMax H3

    国内开源多模态

    MiniMax M3(2026-06-01)约 428B 总参数、23B 激活,原生多模态(图像、视频输入,可操作电脑桌面),100 万上下文,采用自研 MSA 稀疏注意力,已开源;MiniMax H3 为跨任务、跨模态的开源模型。

  • Cohere

    Command A+ / Embed v5 / Rerank v4

    国外闭源多模态

    Command A+(2026-05)新增图像输入、推理与翻译能力(12.8 万上下文);Command A 为 25.6 万上下文的工具调用与 RAG 模型;Embed v5.0 与 Rerank v4.0 各有 Pro / Fast 两档。

  • 快手

    可灵 3.0 / 3.0 Omni

    国内闭源多模态

    可灵 3.0(2026-02)含 Video 3.0 / 3.0 Omni 与 Image 3.0 / 3.0 Omni,单段最长 15 秒并原生生成多语种音频,后升级支持原生 4K;4.0 API 即将上线;2026-09-15 起下线 1.x、2.0、2.1 等旧模型。

  • 生数科技

    Vidu / Vidu S2

    国内闭源多模态

    Vidu 支持文生、图生与参考生视频;Vidu S2 为实时交互模型,提供实时视频数字人与实时视频编辑,画质升至 720P。

  • 小米

    MiMo-V2.6

    国内开源多模态

    MiMo-V2.6 系列(2026-09-22:pro、flash、pro-ultraspeed)原生全模态(文本、图像、视频、音频),100 万上下文并已开源;V2.5 系列采用 MIT 协议。

  • NVIDIA

    Nemotron 3 / Cosmos

    国外开源多模态

    Nemotron 3 开放模型家族:Nano(30B / 3B 激活)、Super(2026-03,120B / 12B)、Ultra(2026-06,550B / 55B),采用混合 Mamba-Transformer 与 Latent MoE;Nemotron 4 规划中;Cosmos 为物理 AI 世界模型。

  • Amazon

    Nova 2 Pro / Nova 2 Lite / Nova 2 Sonic

    国外闭源多模态

    Nova 2 Pro 为旗舰(文本、图像、视频、语音输入);Nova 2 Lite 支持 100 万上下文与三档思考强度;Nova 2 Sonic 为端到端语音对话模型;旧版 Nova Premier 已于 2026-09-14 停用。

  • Microsoft

    MAI 系列 / Phi

    国外开源与闭源并存多模态

    Build 2026(6 月)发布 7 款 MAI 自研模型:推理模型 MAI-Thinking-1(35B 激活 MoE,25.6 万上下文)、编程 MAI-Code-1-Flash、MAI-Voice-2、MAI-Transcribe-1.5 与 MAI-Image-2.5;9 月 MAI-Image-2.6 上线;Phi 为开源端侧小模型。

  • Midjourney

    Midjourney V8.2

    国外闭源多模态

    V8(2026-03)大幅提升指令遵循、文字渲染与出图速度;V8.1 自 2026-06 起为默认模型;V8.2(2026-07)进一步提升审美、画质与个性化。

  • Recraft

    Recraft V4.1

    国外闭源多模态

    V4(2026-02)强调设计审美,可生成可编辑的 SVG 矢量图;V4.1(2026-05)写实与插画效果进一步提升;V4 全系在免费计划中可用。

  • Black Forest Labs

    FLUX 3 / FLUX.2

    国外开源与闭源并存多模态

    FLUX 3 为统一多模态基础模型:视频带原生音频、单次最长 20 秒、最高 4K,也可生成图像;FLUX 3 Action 为 7B 开放权重世界动作模型(机器人控制);FLUX.2 / FLUX.2 Max / Klein 经 API 提供,部分权重以非商用或自托管商用许可开放。

  • Ideogram

    Ideogram 4.0

    国外开源多模态

    9.3B 开放权重文生图模型:密集文字渲染、原生 2K、透明背景与版式控制,适合海报、Logo 与品牌物料,可按许可证本地使用;另有 P-Image-Ideogram 快速模型。

  • Adobe

    Firefly Image Model 5

    国外闭源多模态

    Firefly Image Model 5 原生 400 万像素出图,写实人像与多层构图更强,并支持用文字直接改图(Prompt to Edit);Firefly 内还可调用 30 多个第三方模型。

  • Stability AI

    Stable Diffusion 3.5 / Stable Audio 3.0

    国外开源与闭源并存多模态

    图像开放模型仍以 SD 3.5(Large / Large Turbo / Medium)为主;2026 年新推出 Stable Audio 3.0(全授权数据训练)与 SV4D 2.0(动态 3D 资产生成)。

  • Runway

    Runway Gen-4.5

    国外闭源多模态

    Gen-4.5 仍为自研旗舰视频模型(文生、图生视频,擅长复杂镜头调度);2026-09 起重点在 Runway MCP(支持 Cursor、Grok 等)与达芬奇插件,平台内也可调用可灵等第三方模型。

  • Luma AI

    Luma Ray3.2

    国外闭源多模态

    Ray3.2(2026-06)面向影视制作:单段最多 16 个关键帧、原生 HDR 与 16-bit EXR 导出、表演与面部表情追踪(最多 8 张脸)。

  • Lightricks

    LTX-2.5

    国外开源多模态

    LTX-2.5 为 22B 音视频联合生成开放模型,支持文生、图生与音频生视频,可本地运行与微调;年营收 1000 万美元以下的公司可免费使用。

  • Pika

    Pika 2.2

    国外闭源多模态

    模型仍为 Pika 2.2(Pikaframes 最长 25 秒);2026-09 改版为视频、图像、声音一体的创作平台,新增视频配音模型,并推出聚合 100 多个模型的 Pika API Club。

  • Perplexity

    Perplexity / Sonar

    国外闭源多模态

    AI 搜索:自动检索多方来源并附引用;推出 Comet AI 浏览器;开发者可通过 Sonar / Sonar Pro API 使用联网搜索能力。

  • Reve

    Reve 2.1

    国外闭源多模态

    Reve 2.1(2026-07-09)原生 4K 输出,版式规划与外文文字渲染更强;图像以代码形式表示,每个元素都可单独编辑。

  • 阶跃星辰

    Step 5 Preview / Step 3.7 Flash

    国内未确认多模态

    Step 5 Preview 为新一代旗舰基模(100 万上下文);Step 3.7 Flash 为多模态推理旗舰(25.6 万上下文);Step 3.5 Flash 专为智能体构建;另有 step-2x 生图改图模型。

  • 蚂蚁集团

    百灵 Ling / Ring

    国内开源多模态

    蚂蚁集团 inclusionAI 的开源 MoE 模型家族:Ling 2.6(含万亿参数版本)面向快速执行的 Agent,Ring 为推理模型;2026-09 开源多模态 Ling-3.0-flash-VL(124B-A5.5B),并发布 Ling-3.1-flash。

  • 美团

    LongCat-2.0

    国内开源多模态

    LongCat-2.0(2026-07-06 开源)总参数 1.6 万亿、平均激活约 480 亿,原生 100 万上下文,面向 Agentic Coding,训练与推理全程在国产算力集群完成;系列累计 12 个模型,覆盖文本、图像、语音与视频。

  • 科大讯飞

    讯飞星火 Spark-X2.5

    国内未确认多模态

    2026-09 发布 Spark-X2.5,并推出 X2.5-4B、X2.5-1.7B 小尺寸版本;星火在语音识别、多语种与方言方面积累深厚,经讯飞星辰 MaaS 平台提供。

  • ElevenLabs

    Eleven v4 / v4 Turbo

    国外闭源多模态

    Eleven v4 为情感表现最强的语音合成模型,v4 Turbo 中位延迟约 100 毫秒;支持 90 多种语言与声音克隆,并提供 ElevenAgents 语音 Agent 平台。

  • Suno

    Suno v6

    国外闭源多模态

    AI 音乐生成。v6(2026-09-09)与华纳音乐、BMG、Believe 等合作开发,分 v6(Pro / Premier 用户)、v6-wild(更具实验性)与 v6-mini(所有用户可用)三档。

模型能力与价格变动频繁,本页只做索引与对照,任何决策前请点开来源链接核对官方最新信息。