扩展调研 · 视频全厂商 + 大模型 + 训练设施(2026-09-22)

方法:6 路 schema 约束 agent 真实网络调研(应用层路经一次限流补跑回收)。 规则:以 2026-09-22 为"现在",只看近 90 天动作 + 未来信号;gaps 为核心产出。 原始结构化输出:workflow run wf_354c2d89-361。


中国模型系视频(火山/阿里/腾讯/智谱/PixVerse)

90 天窗口内(2026-06-22 至 2026-09-22),中国视频生成厂商的 Agent 接入面呈现"一家独走、四家缺位"格局:火山/阿里/腾讯/智谱四大厂均无官方视频生成 MCP 或 Agent Skill(mcp.so 上即梦/CogVideo/DashScope/混元相关条目全为第三方,部分甚至用逆向接口),唯一例外是 PixVerse(爱诗科技)——它同时维护官方 CLI(MIT,npm 1.4.5,2026-09-20 仍更新)、官方 MCP 和官方 SKILL.md(v1.28.0,含 execution-contract/prompt-contract、11 个工作流、离线 capabilities 查询),直接验证了"契约优先 CLI + Agent Skill"路线可行且已有人占位。闭源侧模型快速迭代:阿里百炼已到 wan2.7-t2v(快照 2026-06-12,强制异步、task_id 24 小时有效)并出现 wan3.0-video 与 happyhorse-1.1 全家桶;火山 Seedance 2.0 支持音画同生、多模态参考(9 图+3 视频+3 音频)、视频延长/编辑、draft 样片模式与 flex 半价离线队列;腾讯混元正迁往 TokenHub(OpenAI 兼容协议 + submit/query 异步对),且混元生视频 API 直接代销 Vidu 与 Kling 全系列;智谱视频线 90 天内零更新(cogvideox-3 停在 2025-07),转而主推 Managed Agents 的 Skill/MCP 托管基建。最大空位:官方异步任务契约五家五套、有效期 24h-7 天不等、计费单价普遍不在 API 文档里,且无人提供统一的等待/恢复/产物持久化/能力矩阵层;开源侧只剩 Wan2.2(Apache-2.0)仍在活跃维护,CogVideo 已停更 10 个月。

近 90 天时间线

Roadmap 信号

做得好的

空位与切入姿势

未解问题

来源


西方与开源视频(LTX/Decart/Genmo/Stability/Moonvalley/ComfyUI)

西方/开源视频模型近 90 天呈双轨收敛:开源侧 Lightricks(LTX-2.5,162 万月下载,<$10M ARR 免费商用)+ ComfyUI 官方构成生态主场,云 API 侧 Decart(四语言 SDK、llms.txt、秒级透明定价)开发者体验最成熟;Genmo 的 Mochi 开源线已死(仓库一年无实质维护、无 release),Stability 视频线停滞转向音频与版权合作,Moonvalley 的 Marey(合规模型)API 仍 waitlist-only,Odyssey 转向世界模型。方向已被官方亲自验证:Comfy-Org 于 2026-07-01 创建 comfy-mcp(本地 40 工具)+ Comfy Cloud MCP + comfy-skills(Claude Code 插件),最大社区桥 artokun/comfyui-mcp 随即宣布弃档——"给本地 ComfyUI 做 MCP 桥"这个空位已关闭。真正的空位在桥之上的一层:除 MiniMax/Comfy 外所有西方厂商(Lightricks、Moonvalley、Decart、Stability、Odyssey)都没有官方 MCP/Skill/CLI;"成本即合约"(dry-run 报价 + 硬顶 + 降级建议)只有 168★ 的 vibeframe 在做;Marey 类"版权可控"能力没有出现在任何接口层的合约字段里。对 contract-first 多供应商 CLI,最优切入:云 API 与本地 ComfyUI 同一契约、license_tier/commercial_safe 与 max-cost 做成协议一等公民、补齐跨本地/云的异步任务等待与恢复。

近 90 天时间线

Roadmap 信号

做得好的

空位与切入姿势

未解问题

来源


视频应用层(HeyGen/Synthesia/D-ID/Captions/Tavus/InVideo/Hedra)

七家应用层厂商的 agent 面已明显分层:HeyGen 与 Tavus 各自具备官方托管 MCP + CLI + Agent Skills 全套(HeyGen 另有 60 万级安装的开源渲染技能 HyperFrames,Tavus 则有 llms.txt/openapi.yaml/skill.md 机器可读全家桶),Synthesia 于 8 月底才入场(首个 skills 仓库 + Billing/Interactive Avatar API),D-ID 只有挂在文档域名上的 MCP 且 SDK 页仍是一张表单,InVideo 完全没有公开 API。下一步方向清晰:Tavus 正把 PAL 升级为可委派任意第三方 MCP 服务器的 agent 平台,HeyGen 正把全部渲染收拢到 Hyperframes 并准备 2026-10-31 日落 v1/v2 API,Hedra 已把开发者平台转型为 75+ 模型的推理聚合 API(api.hedra.com v3)。最大空位有四个:除 HeyGen 外无人提供"超时可恢复"的异步任务契约;第三方注册表(mcp.so)同时缺失 Tavus 与 D-ID 的官方 MCP;Captions/Hedra 文档在本环境不可达、无人做机器可读转译;免费本地渲染技能(60-63 万安装)与计费 API 技能(1-3 千安装)之间两个数量级的鸿沟无人布局——这些正是独立开发者契约优先多厂商 CLI 的切入口。

近 90 天时间线

Roadmap 信号

做得好的

空位与切入姿势

未解问题

来源


大模型厂商(OpenAI/Anthropic/Google/Meta/xAI/Mistral + 中国阵营)

近 90 天 11 家厂商的动作集中在三条线:通用 agent 编排基础设施(OpenAI Agents API 托管 Codex harness、Google ADK 2.x 声明式 YAML 图工作流 + 模型故障转移、xAI Grok Build Workflows、DeepSeek Harness 预览、字节 Coze Loop 观测评测)、编码 CLI 军备竞赛(qwen-code 日更 + TS SDK、kimi-code、智谱 ZCode,且 DeepSeek 直接提供 Anthropic 兼容端点)、以及视觉/视频原生模型(GLM-5.3-Flash 原生理解图像视频、DeepSeek-V4.1-Flash 原生视觉、xAI Imagine Video 1.5 References、Seedance 2.5"一镜到底"、Meta Muse Video)。下一步最值得借力的是 Google——唯一把"agentic video understanding(判片)"与 Veo 生成放在同一官方文档中,可作为判片环节的一等公民后端;分镜规划与 prompt 扩写可用各家旗舰 agent 模型承担,契约与状态机由读者自己的 CLI 持有。核心判断经逐家核验后仍然成立:没有任何厂商提供"视频生成编排层"——所有编排产品都面向 coding/通用任务,视频模型全是无状态单点调用,判片无标准 JSON schema、分钟级异步任务无统一恢复语义、无单条视频全成本账单,这正是契约优先多厂商 CLI 的最大空位。中外生态差异上,中国阵营以"Anthropic 兼容端点 + 复刻 Claude Code 形态的自建 CLI"快速对齐,但官方 MCP server 与 SKILL.md 生态几乎空白,互操作桥是第二大空位。

近 90 天时间线

Roadmap 信号

做得好的

空位与切入姿势

未解问题

来源


训练/微调基础设施(Together/RunPod/Replicate/Modal/Fireworks/Lambda/硅基流动)

七家训练/推理基础设施厂商在最近 90 天里把「视频生成托管」卷得很凶——Together 聚合了 Seedance 2.5/2.0、Wan 2.7、Kling、Vidu 并按条计价,RunPod 上架 Wan 2.2/2.6 端点(含可外挂 LoRA 权重的变体),Replicate 拥有最大视频目录(Sora-2、Veo 3.1、Kling v3、Wan 3 等),硅基流动托管 Wan2.2——但「视频微调 as a service」在全部七家全面缺位:所有微调产品都止步于 LLM(+VLM/生图),视频角色一致性只以三种零散形态存在(Modal 自管代码示例、RunPod 端点吃外部 LoRA URL、厂商 reference-image API)。Agent 集成在推理侧已经内卷(RunPod 双 MCP+官方 skills 插件、Together 12 个 SKILL.md+docs MCP、Replicate remote MCP+code mode、Fireworks firectl+docs MCP),训练侧的 agent 化只有苗头(Fireworks agentic RL、Lambda 研究线)。对你的 contract-first 多供应商视频 CLI 而言,最大空位非常清晰:没有任何一家提供「一条命令完成角色视频 LoRA 训练→权重托管→agent 可调用」的服务,且视频侧的长任务恢复、URL 过期归档、成本归一化语义普遍比 LLM 侧落后一代。

近 90 天时间线

Roadmap 信号

做得好的

空位与切入姿势

未解问题

来源


LLM × 视频交叉(编排/判片/分镜契约/MCP 化)

LLM 当视频流水线"大脑"已成厂商共识,但 90 天实况是:大脑全都关在自家围墙里——fal Agent(选模/批量/失败修复)、Runway Dev MCP + Model Router、Google agentic video understanding,全部是平台内或聊天内能力,没有一个把"判片"做成独立 API。多模态原材料已经就绪且成本骤降:Gemini 9/1 上线 agentic 视频理解(长视频省 88% token)、Omni Flash 把对话式视频编辑/扩展/插值做进 API、Qwen3-VL 开源提供秒级时间戳定位,"每条生成结果过一遍 VLM"在经济上已可行。最大的空位正是判片/验收层:不是有人做了没声量,而是产品化 API 层面真没人做——fal 官方文档明说对比卡"不给结论,用户自己决定",Runway 的 quality 路由是静态模型排名而非逐条评分,行业评测仍靠 Artificial Analysis 人肉投票和 VBench 学术基准。对独立开发者的直接含义:prompt 遵循度/连贯性/运动质量的结构化判片 + 判片驱动重试,是当前唯一"厂商都没做且原材料已备齐"的层,恰好适合以 contract-first CLI 形态切入。

近 90 天时间线

Roadmap 信号

做得好的

空位与切入姿势

未解问题

来源