深挖第二轮 · 竞品 / 一致性配方 / 判片设计 / 合规标准 / 源码考古(2026-09-22)

方法:8 路 schema 约束 agent(资本路数图路因网络故障待补跑;价格表与能力矩阵两路已直接灌入 data/prices.jsondata/capabilities.json,不入本文件)。 规则:以 2026-09-22 为"现在",一手来源优先,空位判断必须附证据。 原始结构化输出:workflow run wf_1b079cd9-5e7。


直接竞品拆解(VideoRouter / vibeframe / muapi 系 / RunComfy / PixVerse / ComfyUI 官方)

六家竞品/近邻拆解(今天 2026-09-22;全部结论附一手 URL,本地 AtlasCloud CLI 仓库为"我们"的定位参照)。

【a) VideoRouter / videorouter.sh(Synvia Corp, Newark CA)】做什么:OpenAI 兼容统一 API 的"OpenRouter for video",按价格/健康度在 Fal、WaveSpeedAI、Atlas Cloud、Replicate、Novita 之间路由,渲染中自动 failover,逐请求列出供应商成本+平台费;自建部分开源权重模型(Wan、HunyuanVideo、MiniMax H3)。商业模式:统一 2% 平台费(对标 OpenRouter 5.5%),无订阅无折扣,BYO key 也照收 2%;报价表直接列出 "MiniMax H3 Developer (Atlas) $0.020→$0.0202/sec"、"Wan 3.0 (Atlas) $0.0404/sec"——Atlas Cloud 是其上游供应商之一。不做什么:不开源平台本身;无 dry-run 成本预检/硬顶;官方 CLI @videorouter/cli 在 npm 不存在(registry 查询 not found),官方 skills 仓库 synvia-corp/videorouter-skills 0★;社区零牵引(HN 9/16 帖 1 分 1 评论,作者 franklin_yao karma=1;9/11 帖 2 分),5 天内从"Save 80%"改为"OpenRouter for video"说明定位仍在漂移。活跃度:官网与定价页活跃,GitHub 生态近乎为零。威胁等级:中高(方向与我们+中立层完全重叠,但执行面是空壳);对 Atlas 同时是渠道而非纯对手。

【b) vibeframe(vericontext/vibeframe, 168★)】做什么:CLI+MCP,让 coding agent 用用户自己的 key 调 Seedance/Runway/Veo/Kling 生成视频;核心契约是 --dry-run 免 key 报价、--max-cost 硬顶(超限返回 COST_CAP_EXCEEDED + retryWith 两条降级路径 + 完整报价 plan)、机器可读错误信封与恢复动作;编排委托 Remotion/Hyperframes(自称非 HeyGen 关联)。商业模式:无(MIT 开源、BYOK、不抽成,npm 包 @vibeframe/cli)。不做什么:不托管、不代账、无统一计费与目录,全部成本透明转嫁。活跃度:单人 Kiyeon Jeon(1110/1117 contributions,bio "AI Engineer");2026-02-01 建仓,最后 push 与最后 release 均停在 2026-07-26(v0.115.2),已停滞 8 周;npm 766 下载/月;51 个 issue 全关闭、0 开放。威胁等级:低(验证了成本契约需求,但不构成商业威胁)。

【c) muapi.ai 系 SKILL.md 合集(SamurAIGPT/Generative-Media-Skills, 4316★)】做什么:面向 Claude Code/Cursor/Gemini CLI 的 100+ 模型技能合集(41 个 UGC/电商向视频图片配方 + core 原语),底层全部走 muapi-cli;UTM 漏斗完整(repo homepage 和 "Powered by MuAPI" 徽章均带 utm_source=github&utm_campaign=generative-media-skills);计费为 Stripe 充值积分(muapi account topup --amount 20 经 Stripe checkout)。定价页宣称比 Fal 低 60-64%(Seedance 2.5 720p $0.34/sec)、比 OpenAI 官方低 29-31%,低于成本价的逻辑不可持续或为引流,抽成率不公开。不做什么:无成本预检;无中立性(只指向 muapi)。真实使用与口碑背离:4316★/494 fork 但 muapi-cli 仅 1,934 npm 下载/月;仓库 2023-05-25 创建,issue 跟踪器里是 privateGPT 时代的旧账("404 after running privateGPT.py"、"Run slowly in my 16G notebook")——星数大量继承自已转型旧仓库;issue 区几乎全是 dependabot 与互推机器人,73 个 issue 中找不到真实用户抱怨,生态靠 SamurAIGPT(99 仓库/619 粉丝)+Anil-matcha(Open-Generative-AI 29k★)约 25+ 个仓库 README 互链刷量。威胁等级:中(分发机器真实存在,但产品与信任面薄)。

【d) RunComfy CLI + genmedia-labs 技能矩阵】做什么:runcomfy-com 官方 Rust CLI(@runcomfy/cli,OAuth+token,models/run/status/result、Serverless ComfyUI 部署、LoRA 训练全流程)+ 官方 skills(12★,走 skills.sh 与 Claude/Cursor marketplace 插件)+ 托管 MCP(31 工具)。商业模式:ComfyUI 云 GPU 托管 + Model API + LoRA 训练,积分计费。3.8M 安装解剖:skills.sh 显示 genmedia-labs/skills(匿名组织,单人 kalvinrv,2026-08-12 建仓、仅 3 commits、13★)33 个技能共 3.8M 安装、357 个 UTM 链接指向 runcomfy.com、零 fal 端点——是 RunComfy 的营销阵地(前期文档已做源码级核实);但顶部 5 个技能安装数 597.5K-599.5K 高度一致,疑似批量/统一计数;真实使用侧 @runcomfy/cli 仅 1,652 npm 下载/月、官方仓库 1★,fal 官方社区 skills 也仅 8.8K 安装且 5/13 停更。周边还有 prime-skills、agentspace-so、doany-ai 等 SEO 式第三方技能农场。活跃度:2026-09 多面并进(cli 9/7、mcp+skills 9/15、gemini 9/6)。威胁等级:分发渠道上中高、产品面上低。

【e) PixVerse 官方 CLI(PixVerseAI/cli, 59★, MIT)+ skills(61★)】做什么:"UI-free 版 pixverse.ai",npm pixverse(4,275 下载/月),OAuth device flow,订阅制积分;约 27 个视频模型(自家 V6/C1 + 第三方 Sora/Veo/Kling/Seedance/Wan/MiniMax/Grok——单厂商聚合者)。契约是全场最佳参照:仓库根 capabilities.json(schema 1.2.0,"Generated from Commander definitions, Do not hand-edit",exit codes 0-7 含 CREDIT_INSUFFICIENT=4、CONCURRENCY_LIMIT=7,trace_id,global/cn 双区);skills/references/execution-contract.md 精确到 streams 分工、批次 partial completion 的 JSON 形态(items/failed_ids/fail_count)、防丢数据的 jq 单行模板;prompt-contract.md 界定"生成不改 prompt、优化需授权、禁止加质量垫话/保留故意孪生与品牌文本"。不做什么:无成本预检(积分不足是运行时退出码)、订阅墙、无跨厂商。活跃度:cli 9/20、skills 9/10 仍在推送(v1.4.5)。威胁等级:低(单厂商),但其契约工件是我们最应吸收的标杆。

【f) ComfyUI 官方两轨(Comfy-Org)】本地轨:comfy-cli(974★,技能随 CLI 二进制分发 comfy skills install)、comfy-mcp(234★,AGPL-3.0-or-later OR Commercial 双许可的 open-core,含 MCP Registry 所有权令牌机制);云轨:comfy-skills(200★,Claude Code 插件 /comfy-cloud:* 斜杠命令 + hosted MCP cloud.comfy.org/mcp)。官方作者规则已成文:"steer the approach, defer the specifics"——安装时固化的命令禁止写死模型名/模板/节点,必须指向运行时 discovery 工具。商业模式:开源引流 + Comfy Cloud 订阅。活跃度:全场最高(9/16-9/21 连发 mcp/skills/python-ts SDK/api-proxy)。威胁等级:对中立层低(云轨只覆盖自家目录),但其作者规则应成为行业标准。

【总判断】这一层目前是"强分发、弱契约":会刷量的(muapi、RunComfy 矩阵)没有统一契约与真实使用;有契约的(PixVerse)只覆盖自家且无成本预检;有成本契约的(vibeframe)是停滞单人项目;方向正确的中立路由(VideoRouter)社区与 agent 面是空壳且已把 Atlas 当上游。差位点详见 gaps。

关键信号

要点 / 模式清单

空位与建议

未解问题

来源


角色一致性技术路线(Wan2.2 LoRA / VACE / 商业 API 形态 / character_id 契约)

角色一致性技术路线深挖(截至 2026-09-22,全部依据可给出 URL 的一手来源)。结论:(1) 自训路线已完全可行——kohya musubi-tuner 官方文档明确支持 Wan2.1/2.2 LoRA,fp8+block swap 下"720x1280 图像训练仅需 24GB 显存"(wan.md 原文),Wan2.2 双 DiT(高/低噪声)可用 --dit_high_noise + --timestep_boundary(T2V 0.875 / I2V 0.9)联合或分段训练;tdrussell diffusion-pipe 支持 Wan2.2 但强制 Deepspeed 流水线并行(面向多卡),提供 wan_14b_min_vram.toml 极限显存配置,且已在 RTX 4090 上验证(PyTorch 2.9+CUDA 12.8)。(2) 单卡成本:RunPod RTX 4090 Community $0.34/hr、Secure $0.74/hr,RTX 5090 $0.69/$0.99,H100 SXM $2.69/$3.49;Modal 按秒计费 H100 $0.001097/s(约 $3.95/hr)、A100 80G 约 $2.50/hr、L40S 约 $1.95/hr(时薪为秒价×3600 折算,非官方报价)。按单卡 4090 训 24 小时估算约 $8-18,属于个人开发者可承受区间;但两平台定价页均无独立 spot/interruptible 档位(RunPod 的低价来自 Community Cloud,Modal 靠按秒计费实现弹性),"spot 补位"的真实形态是被抢占风险更低的社区云/按秒计费。(3) 参考控制路线:开源侧 VACE(Wan2.1-VACE-1.3B/14B,Apache-2.0,R2V 参考生成,--src_ref_images)与 ByteDance Phantom(Wan2.1 基座,单/多主体参考≤4 图,Apache-2.0)都停在 Wan2.1,尚无 Wan2.2 版本;闭源侧已收敛到"@名字"引用范式——Kling 3.0 Omni 的 contents[].type=element(element_id + @名称语法,单任务最多 3 个 element,配 Element Management API)、Vidu reference2video 的 subjects[](每主体≤3 图、@subjectname 引用、总量≤7、viduq1-q3/2.0)、火山 Seedance 2.5 的 omni_reference_task_type + role=reference_image/reference_video(@图像1/@视频1 语法,doubao-seedance-2-5-260628)。(4) 数字人路线:HeyGen Avatar V 主打"Character consistency across every angle, expression, and video",REST/CLI/MCP 接入、批量 100 请求/调用,但 API 单价藏在登录墙后;ByteDance OmniHuman-1/1.5(图像+音频驱动、1 分钟以上动态表演)明确闭源——官方页声明"we do not offer services/downloads anywhere"。(5) 修正性发现:fal.ai 已有 fal-ai/wan-trainer/t2v-14b("Train custom LoRAs for Wan-2.1 T2V 14B")——"训练设施厂商完全不做视频 LoRA 托管训练"的前提不成立,真实情况是覆盖极薄(仅 Wan2.1 T2V 一个模型,无 Wan2.2、无 I2V)。这为 character_id 契约 + 托管 Wan2.2 双专家 LoRA 训练配方留出明确机会:契约需包含数据集规格(视频+同名 .txt 字幕 / musubi JSONL)、LoRA 权重引用(区分高/低噪声 DiT、timestep_boundary)、trigger 词、一致性评测集、以及四套商业端点适配器(element_id / subjects / reference_image / avatar_id)。

关键信号

要点 / 模式清单

空位与建议

未解问题

来源


判片与验收层设计(VBench / VLM judge / 抽帧 / verdict schema)

判片/验收层设计深挖(judge rubric + verdict schema 设计输入)

a) 先例体系

VBench(官方仓库已核对,16 维,精确名称):质量 7 维——subject_consistencybackground_consistencytemporal_flickeringmotion_smoothnessdynamic_degreeaesthetic_qualityimaging_quality;语义 9 维——object_classmultiple_objectshuman_actioncolorspatial_relationshipscenetemporal_styleappearance_styleoverall_consistency。权重与归一化在 scripts/constant.py 开源。VBench-2.0(arXiv 2503.21755)转向"内在忠实度":18 个细粒度维度覆盖物理合理性/常识推理/人体运动,但具体维度名未在 README 列出。关键启示:temporal_flickering/motion_smoothness 这类维度 VLM 在低帧率下不可见,判片维度必须按"VLM 可判性"重新分层。 VideoFeedback(TIGER-Lab,官方 HF 页核对):33.6k 条(test 680),每条 8-24 帧 JPG + prompt + mp4 链接 + 5 个整数分:visual quality / temporal consistency / dynamic degree / text-to-video alignment / factual consistency;数据页观测为 1-4 分制(中置信,与论文口径需复核);标注方式即"GPT-4V 扮演判片专家"的多轮对话——这就是 VLM-as-judge 判视频的最直接数据先例,可直接取样本做 judge few-shot 校准。 EvalCrafter(CVPR 2024):17 个客观指标 + 8.6k 人工标注(5 个方面,明确含 visual quality 与 t2v alignment),工具箱含 RAFT(光流)、DOVER、CLIP 等——光流在评测界是运动度量而非选帧手段。 图像域 VLM-as-judge 产品化先例:VIEScore(官方仓库核对)对图像生成/编辑输出 SC(语义一致)+ PQ(感知质量)+ Overall 三分,--mllm 支持 gpt4v/gpt4o/gemini 等 10 种后端,官方 news 声明"GPT-4o 达到与人类 on par 的相关性";仓库内已有 t2v 任务标记。DALL-E 3 报告用 GPT-4V 做自动评测是业界惯例(单一来源、本次未复核一手 PDF,低置信)。

b) Judge 候选 VLM 能力矩阵(全部官方一手来源)

模型 视频输入 关键机制 价格/1M(in/out) 判片适配
Gemini 3.8 Flash 原生 mp4/mov/webm 等 9 种 agentic 模式"processing":"agentic"):模型"选择性查看 transcript、动态调整帧率与分辨率",response steps 出现 processing_call/processing_result 即自导航时间线;官方称长视频"最多省 88% token、质量 +7%"。静态模式默认 1FPS,低分辨率 66 token/帧、高分辨率 258 token/帧,音频 32 token/秒;自定义 fps 与裁剪仅静态模式;prompt 可引用 MM:SS 时间戳 $0.75/$3.75(促销价至 2026-12-31,之后 $1.50/$7.50);Batch 半价 首选 judge:原生视频 + 时间戳引用 + 自适应抽帧,10s 判片成本约 $0.005
Qwen3-VL(235B-A22B-Instruct) 原生视频,"小时级视频全召回 + 秒级索引",Text-Timestamp Alignment 时间戳定位 默认 fps=2,视频 token 预算上限 16384,上下文 256K(YaRN factor=3 可扩 1M) OpenRouter 实测:$0.21/$1.9(235B)、$0.13/$0.52(30B-A3B)、$0.117/$0.455(8B)、$0.104/$0.416(32B);OpenRouter 侧 input_modalities 仅 text+image(视频需转帧图传入) 失败事件秒级定位最佳;自建推理可自控抽帧
Claude(全系) 无视频输入,官方原文:"Animations are unsupported, and only the first frame is used"(GIF 只取首帧) 规避方案:抽帧转多图。API 单请求最多 600 张;超过 20 张触发 2000px 长边硬限(否则 invalid_request_error);1920×1080 帧标准档降采样到 1456×819=1560 token,高分辨率档(4.7+)4784 token 10 帧 ≈ 15.6K token,Haiku 4.5($1/1M)约 $0.016/次——比 Gemini 原生贵 3-5 倍 仅适合"网格拼图"式降采样判片(如 3×3 网格=1 张图),不推荐做主 judge
GLM-4.6V(z.ai 官方) 支持视频(Input Modality: Video/Image/Text/File),128K 上下文,"一次推理约一小时视频" 原生 Function Calling;具体帧/像素上限文档未给 $0.3/$0.9;FlashX $0.04/$0.4;Flash 免费 Flash 免费/FlashX 做"粗筛级",FlashX 价格约为 Gemini 的 1/10
DeepSeek V4.1-Flash(官方定价页) 定价页标 vision ✓(deepseek-v4-pro 无视觉);是否支持视频未确认 1M 上下文;峰谷价差 2 倍(谷时=UTC 周一至五 01-04 及 06-10 点) in $0.15(谷)/ $0.3(峰);out $0.6/$1.2 若支持视频则为谷时批量判片的低价选项,需先验证

c) 抽帧方案对比

d) 设计草案

verdict JSON schema v1.0

{
  "verdict_version": "1.0",
  "generation": {"generation_id": "gen_xxx", "provider_model": "...", "request": {"prompt": "...", "params": {"seed": 0, "duration_s": 10, "resolution": "1080p"}}, "artifact": {"video_url": "...", "sha256": "..."}},
  "evidence": {"sampling": {"method": "uniform|adaptive|two_pass", "fps_sent": 1.0, "n_frames": 10, "timestamps_s": []}, "judge": {"model": "gemini-3.8-flash", "processing": "agentic", "tokens_in": 0, "tokens_out": 0, "cost_usd": 0.0, "rubric_version": "r1"}},
  "alignment": {"elements": [{"element_id": "e1", "type": "subject|action|scene|style|count|text|camera", "text": "prompt 原文片段", "present": true, "timestamps_s": [1.5], "note": "..."}], "adherence_score": 8.5, "missing": ["e3"], "contradicted": []},
  "dimensions": [{"id": "prompt_adherence|subject_consistency|temporal_consistency|motion_quality|visual_quality|aesthetics|safety_overlay", "score": 8.5, "confidence": 0.9, "evidence_ts_s": [1.5, 4.0]}],
  "failures": [{"code": "IDENTITY_DRIFT", "severity": "minor|major|hard", "timestamps_s": [6.0], "description": "主角发色第6秒改变"}],
  "failure_codes": ["PROMPT_OMISSION","PROMPT_CONTRADICTION","COUNT_ERROR","SPATIAL_RELATION_ERROR","TEXT_RENDER_ERROR","IDENTITY_DRIFT","OBJECT_VANISH","OBJECT_DUPLICATE","MORPHING","FLICKER","GHOSTING","MOTION_ARTIFACT","PHYSICS_VIOLATION","ANATOMY_ERROR","WATERMARK_LOGO","COMPRESSION_ARTIFACT","COLOR_SHIFT","FRAMING_ISSUE","UNSAFE_CONTENT"],
  "overall": {"score": 7.8, "verdict": "pass|conditional_pass|fail", "confidence": 0.85, "one_line": "..."},
  "action": {"recommended": "accept|retry_same_model|retry_other_model|revise_prompt|abandon", "reason": "...", "hints": {"target_failure_codes": ["IDENTITY_DRIFT"], "prompt_suggestion": "...", "fallback_model": "..."}, "retry_budget_left": 1}
}

判定→动作映射(写进 rubric 尾部):overall≥8 且无 major/hard 失败且 adherence≥7 → accept;adherence 缺失/矛盾(PROMPT_OMISSION/CONTRADICTION/COUNT/SPATIAL)→ revise_prompt;FLICKER/ARTIFACT/MOTION 等瞬态类且 overall≥5 → retry_same_model(换 seed);IDENTITY_DRIFT/PHYSICS_VIOLATION 且当前模型已知此弱点 → retry_other_model;hard 失败(UNSAFE/WATERMARK)或重试 2 次后仍 <5 → abandon。

judge rubric(可整段贴 system prompt)

你是 AI 生成视频的验收判片员。输入:原始 prompt + 按时间戳标注的帧序列。规则:
1) 先证据后打分:每个维度分数必须引用 MM:SS 时间戳,无证据的分数无效。
2) 只扣 prompt 要求的东西:prompt 未提及的属性不扣 alignment 分。
3) 分制 0-10 锚点:9-10 优秀(该维度无可挑剔);7-8 良好(轻微瑕疵不影响使用);5-6 及格(明显缺陷但仍可用);3-4 差(影响观感/偏离要求);0-2 崩坏(不可用)。
4) prompt_adherence:9-10=所有元素出现且无矛盾;7-8=主要元素在、次要缺失;5-6=主体对但动作/风格偏;0-4=主体错误或与 prompt 相反。
5) subject_consistency:0-4=身份改变/换人;5-6=衣着发型漂移;7-8=轻微变化;9-10=跨帧完全稳定。
6) temporal_consistency:9-10=背景物体无闪变;5-6=局部闪烁/物体短暂消失;0-4=场景突变级不一致。
7) motion_quality:0-4=运动崩溃/形变;5-6=卡顿滑步;7-8=偶发抖动;9-10=平滑且符合物理。
8) visual_quality:按伪影/模糊/压缩逐级;aesthetics:构图/色彩/光影。
9) safety_overlay 为硬性项:水印/logo/不当内容 → 直接在 failures 记 hard 并给 verdict=fail。
10) 不确定时给保守分并降低 confidence 字段;两难时以"用户会不会要求退款"为准。
11) 输出仅限 verdict JSON,禁止额外文本。

总成本参考(10s 1080p 单次判片,官方价推算)

Gemini 3.8 Flash 静态低分辨率 ≈ $0.005(980 in + 1K out token);agentic 短视频成本相近、TTFT 略增;Qwen3-VL 235B(OpenRouter)≈ $0.006;GLM-4.6V-FlashX ≈ $0.001;Claude 帧图方案 ≈ $0.016 且受 20 张/2000px 限制。批量验收层建议:GLM-Flash 免费粗筛 → Gemini 3.8 agentic 精判 → 争议样本 Claude 高分辨率网格复核。

关键信号

要点 / 模式清单

空位与建议

未解问题

来源


合规与标准(内容标识办法 / C2PA / SKILL.md 治理 / MCP 演进)

合规与标准深挖结论(截至 2026-09-22,全部基于一手来源实测/抓取):中国侧,《人工智能生成合成内容标识办法》(国信办通字〔2025〕2号,2025-09-01 施行)与强制性国标 GB 45438-2025(2025-02-28 发布、2025-09-01 实施、现行)构成"显式标识(视频:起始画面+播放周边显著提示,下载导出须保留)+ 隐式标识(文件元数据须含生成合成属性、服务提供者名称/编码、内容编号)"双层义务,传播平台有三情形核验义务(办法第6条),用户可依第9条约定"无显式标识交付"但需协议+≥6个月日志。四家视频 API 实测(官方文档抓取):可灵 options.watermark_info.enabled 默认 false、火山方舟 Seedance watermark 默认 false、Vidu watermark 默认不加(但默认水印文案即"内容由AI生成",支持 wm_url 定制与 watermarked_url 返回)、MiniMax 英文 API 全文档零水印参数——即显式标识责任系统性落在调用方,且无一家文档化 AIGC 隐式元数据输出(第5条符合性盲区,契约需设计 label_required / implicit_metadata / c2pa / 责任划分字段)。国际侧,C2PA 规范已到 2.3,TikTok/OpenAI/Google/Meta 均在指导委员会;YouTube 官方确认会依据 C2PA 元数据或内部检测自动打 AI 标、反复不披露可下架或取消 YPP 资格。规范治理侧,SKILL.md 由 Anthropic 首创后"以开放标准发布、向生态开放贡献"(agentskills.io 官方原文),未见捐入中立基金会、无规范版本号/变更日志/兼容承诺,allowed-tools 仍标注 Experimental("支持程度因 agent 实现而异")——第三方 skill 存在兼容风险,规格内已提供 compatibility 字段与 skills-ref 校验器作缓解。MCP 当前版本 2026-07-28 完成无状态化重构:"Stateless, self-contained requests"+按请求版本/能力协商(_meta + MCP-Protocol-Version 头)+强制 server/discover;Roots/Sampling/Logging/动态客户端注册被弃用(最早 2027-07-28 可移除),HTTP+SSE 传输可在 SEP-2596 转 Final 三个月后移除;长任务应迁移到 Tasks 扩展(io.modelcontextprotocol/tasks:CreateTaskResult/taskId 持久化/轮询/input_required 中途输入/取消),其语义与视频生成这类分钟级任务高度契合,但属 opt-in 扩展、客户端支持矩阵未定。

关键信号

要点 / 模式清单

空位与建议

未解问题

来源


本地源码考古 + PixVerse 参照(契约设计模式提取)

对 7 个本地克隆仓库(anthropics/higgsfield/runwayml/runway-mcp/atlascloud/fal/elevenlabs 共 103 个 SKILL.md)做了契约设计模式考古,并以 PixVerse 官方仓库(skills + cli)为远程对照。核心发现:(1) frontmatter 三代演进——官方最小 name+description → 厂商扩展(version/user-invocable/allowed-tools/argument-hint/metadata),description 写法上 higgsfield 的「Use when 触发词 + NOT for 反向路由 + Chain with 链式声明」是技能间路由的最优解,无需任何额外机制;(2) 异步表达三派——CLI 阻塞(higgsfield --wait,默认 10m 超时/3s 间隔,rejoin 用 generate wait )、SDK wait-helper(runway waitForTaskOutput,'Submit once; do not add a manual polling loop')、显式轮询(fal --async→request_id→status;atlas 固定 2s),共同不变量是轮询静默、永不重复提交、状态查询只读;(3) 计费披露两极——runway 全透明(SKILL.md 内置每模型 credit 表、输出行带成本、get_credit_balance 前置)vs higgsfield「不预算成本、除非用户问」(cost 子命令按需),atlas 独特:把成本语义编入状态机(重试=显式决策,先报旧 ID 与新增成本);(4) 错误处理四形态——错误→动作映射表(runway)、按报错字符串的 playbook 含 CLI 版本 bug workaround(higgsfield troubleshooting.md)、终态/非终态分类学(atlas:timeout/慢输出/轮询中断≠失败)、退出码语义学(PixVerse exit 0-7,'exit 0≠生成完成'、'exit 2 timeout≠提交失败');(5) 组合模式四派——基座+表面技能(runway-dev + '+' 语法)、基础技能+路由数据技能(fal genmedia + model-routing)、能力与方法论分离(atlas spec/execution 二分)、单入口三路由表(PixVerse 唯一 SKILL.md + capabilities/ + workflows/ + 'Read only what the task needs');(6) PixVerse 作为最接近路线的参照,其独有价值是把契约拆成三份独立文件:execution-contract.md(stdout/stderr 流分离、ID 分型与可移植性、部分批处理形态学、幂等键、并发退避 5/10/20s、cost_credits 缺失≠免费)、prompt-contract.md(生成式请求不改写、'Optimize and generate' 一次授权、禁止 mandatory quality/logo/subtitle pads、'Missing decorative detail is not a reason to ask questions')、persistent-assets.md(角色/道具注册表),加上 capabilities.json 离线机器可读能力发现与不耗 credit 的离线回归测试套件。对照 Atlas CLI 现状(近期 commit 已有 agent input/recovery/artifact contracts 与 generate JSON contract),主要空位在:退出码语义表、幂等键、prompt 改写授权契约、部分失败输出形状、prose 回归测试。

关键信号

要点 / 模式清单

空位与建议

未解问题

来源


资本路数图(money-map,2026-09-22 补跑回收)

摘要:2026-09-22 视频生成生态资本路数:a) fal:Series D($140M,Sequoia 领投,2025-12-09 官宣,估值 $4.5B)为最后官方轮;$8B 的 Series E-2 截至 2026-09-22 仍只是 The Information 2026-03-19 报道的"谈判中"($300–350M),官方博客无 Series E 公告;ARR $400M 为二手单一来源(ARR Club,2026-03)。b) 可灵:快手已于 2026-05-12 在港交所发自愿性公告,官方确认"董事会正评估重组可灵 AI 相关资产及业务以获取外部财务资源"并拟议独立上市,但明确"仍处初步阶段、未签最终协议";媒体传估值最高 $20B/近 1560 亿港元、最早 2027 挂牌;WSJ 2026-07-03 报已完成约 28 亿美元融资(标题 slug 与中文站金额口径有差异);无 HKEX A1 备案证据;2025Q4 可灵收入 RMB 3.4 亿(36kr 引快手财报)。c) Replicate:2025-11-17 被 Cloudflare 收购(双方官方博客),对价未披露;官方承诺 5 万+模型迁入 Workers AI、微调能力并入、API 不变;头部创作者 fofr 截至核查日仍活跃(Qwen 系微调、face-swap-with-ideogram 39.3K runs 等),但交易对创作者分成机制的影响未披露,独立"中立托管"品类实质消失。d) RunComfy:法律实体与融资历史无任何公开记录(官网隐私页 404);其 GitHub 关联组织 genmedia-labs 自述发布 runcomfy-agent-skills(Claude agent 技能分发),说明其转向 agent 层。e) PixVerse/爱诗科技:2026-03 完成 $300M C 轮,2026-07-14 完成 $439M C 轮扩展、估值突破 $2B,2026-04 传考虑最快年内赴港上市(传闻级)。f) HeyGen 无 2026 新轮(Latka 9 月报 ARR $200M);Lightricks 停在 $335M/D 轮无新动作;Decart 2026-05 完成 $300M C 轮(Radical Ventures 领投、Nvidia 参与,估值口径 $3.1B vs 近 $4B 存分歧);Moonvalley 最近官方轮为 2025-07 $84M(General Catalyst 领投,CAA/Comcast Ventures 参与)。g) 国内:MiniMax 已于 2026-01-09 港股挂牌(首日收盘 +109%、市值破千亿港元);智谱 2026-06 完成科创板辅导验收并同日开源 GLM-5.2;阶跃星辰 2026-01 完成 50 亿+元 B+ 轮、2026-04-13 Reuters 报拆境外架构备战港股 IPO、2026-05 证券时报报即将完成 25 亿美元新融资(华勤技术等产业资本入场)。整体格局:云厂吞并中立托管(Cloudflare–Replicate)、港股 AI 上市窗口打开(MiniMax 打样、可灵/PixVerse/阶跃排队)、中立推理层估值重估(fal $4.5B→$8B 谈判)、资金从纯 VC 转向战略/产业/好莱坞资本。

90 天时间线(全部带源)

资金面信号(将要做/正在发生)

做得好的(资本面健康信号)

空位与机会(可占位)

未决问题

来源