← Files Atlas CloudARCHIVED FILE
skills/universal-video-prompt-skill/references/model-profile-schema.zh-CN.md
7.39 KB · Oct 5, 2026 · 18:26 UTC
# 模型档案字段定义 档案是让这个 skill **随模型调整**而不只是描述模型的东西。本文件定义**字段**;每个模型有自己填好的一份实例。 两条规则贯穿每一项: 1. **记测量值,不记印象。** 「时序有漂移」没法用;「15 秒的片子里请求的拍点整体晚约 2 秒」可以编译成决策 2. **「未知」是合法值。** 空字段会触发一次探测;猜出来的字段会静默污染每一次编译和每一份基于它的对比 ## 模板 ```markdown # 模型档案:<厂商>/<模型> 最后核实:<日期> · 核实人:<谁> · 服务:<你调的是哪个> ## 能力位层 | 字段 | 值 | 如何核实 | |---|---|---| | 素材寻址语法 | | | | 素材数量上限(图 / 视频 / 音频) | | | | 一次生成能否多镜头 | 能 / 不能 / 部分 | | | 是否支持硬切 | 能 / 不能 | | | 时长范围 | | | | 分辨率选项 | | | | 原生音频 | 原生 / 仅参考 / 无 | | | 时序遵循度 | | | | 建议粒度 | 不写 / 分段 / 秒级 | | | 首帧 / 首尾帧 | | | | 延长或接龙 | | | | 视频编辑 | | | | prompt 长度耐受性 | | | ## 偏置层 | 字段 | 值 | 如何核实 | |---|---|---| | 默认审美偏置 | | | | 有效的反默认写法 | | | | 无效或过冲的写法 | | | | 负向锁行为 | | | | 可识别的转场词汇 | | | | 语言敏感性 | | | ## 已知失败模式 - <什么会坏、在什么条件下坏、有没有绕法> ## 编译注记 - <针对这个模型必须做的特殊处理> ``` ## 字段说明 ### 能力位层 **素材寻址语法** —— 绑定素材的那个确切 token。唯一必须翻译而不能用描述替代的东西。**照字面记。** **素材数量上限** —— 分类型记,如果有总上限也记。厂商同时给出「稳定范围」和「文档上限」时分开记——稳定性通常在硬上限之前就开始下降。 **一次生成能否多镜头** —— 一次请求能否产出带切点的有序镜头?`部分` 意味着能用但不稳,要写清什么条件下会失败。 **是否支持硬切** —— 与多镜头分开。有些模型能出多个镜头,但总是用运动把它们连起来。 **时长范围** —— 以及时长是靠参数设定还是从输入推断。哪些任务类型会锁死它,也要记。 **原生音频** —— `原生` 会生成声音,`仅参考` 只接受音频输入,`无` 表示编译时应删掉音频行。 **时序遵循度** —— 记测量值,并附上测量时的片长。**方向很重要**:稳定偏晚可以靠提前写来补偿;不稳定则根本没法补偿。 **建议粒度** —— 从时序遵循度推出的结论。这是编译器实际读的那个字段。 **prompt 长度耐受性** —— 提示词变长时,这个模型会牺牲什么。实测存在极大的模型间差异:有的模型加长后开头整段丢失且质感锁被稀释,另一个模型在同样两份提示词上全部保住。 ### 偏置层 **默认审美偏置** —— 不给任何风格指令时它落在哪。要具体:`磨皮美颜脸`、`CG 感表面`、`过饱和的调色`。这就是反默认写法要打的东西。 **有效的反默认写法** —— 在**这个**模型上实测让输出移动了的写法。 **无效或过冲的写法** —— 同样有价值,而且是最常被跳过的字段。过冲的写法比毫无作用的写法更糟,而这里正是记录「从别的模型搬来的技巧反而起了反作用」的地方。 **负向锁行为** —— 负向会被尊重吗?哪一类会失效? **可识别的转场词汇** —— 哪些具名转场不加限定就能落地。其余的都需要术语 + 描述双写。 **语言敏感性** —— 提示词语言会改变结果吗?哪种语言最强?某个术语只在一种语言里生效,也记下来。 ## 填好的示例:`bytedance/seedance-2.0` ```markdown # 模型档案:bytedance/seedance-2.0 最后核实:2026-08-03 · 服务:Atlas Cloud ## 能力位层 | 字段 | 值 | 如何核实 | |---|---|---| | 素材寻址语法 | `@image1`、`@image2`… | 生成实测 | | 素材数量上限 | 9 张图 | 厂商文档 | | 一次生成能否多镜头 | 能——带切点的有序段落 | 15 秒多段生成 | | 时长范围 | 4–15s | 厂商文档 | | 原生音频 | 有 | 开启音频的生成 | | 时序遵循度 | 15 秒的片子里请求拍点**整体晚约 2 秒**;段落**顺序稳** | 对着带时间戳的提示词做的受控 15 秒实测 | | 建议粒度 | **分段** | 由上一行推出 | | prompt 长度耐受性 | **高。** 加长版本保住了手、开场变形、手绘质感,还吃下了新增拍点 | 同一份 spec 的 v3 | ## 偏置层 | 字段 | 值 | 如何核实 | |---|---|---| | 默认审美偏置 | 镜头先验很强;稀疏提示词理解得好,会合理即兴 | 与过度指定版本做 A/B | | 有效的反默认写法 | **按工具命名,不要命名抽象属性。** `蜡笔/彩铅/粗笔刷,看得见排线方向、涂色不均、毛边` 给出了真正的手绘笔触 | 同一份手绘 VFX spec 的受控 A/B | | 无效或过冲的写法 | **`保持平面图形、绝不写实` —— 被精确满足、且毫无用处。** 模型用光滑的霓虹管矢量描边加均匀填充满足了它:平面,但完全不手绘。在同一份 spec 上只把这一条锁换成工具名,结果直接反转 | 同上 | | 无效或过冲的写法 | **喂故事板网格过度指定,比纯文字 staging 更差** —— 会压掉让重特效镜头成立的运镜先验 | 同一段落的 A/B | | 负向锁行为 | 会被尊重。前置 | 迭代 | | 参考图与文字的优先级 | **图赢。** 构图参考会覆盖写出来的构图 | 迭代 | ## 已知失败模式 | 症状 | 细节 | 处理 | |---|---|---| | 小字出错 | UI 标签与招牌出现字符级错误,小字乱码 | 需要完全准确的文字走后期 | | 列表项漏画 | 枚举的菜单项只画出一部分 | 减少条目数,或文字走后期 | | 运镜被忽略 | 写明的运镜被跳过,段落其余部分正常 | 把运镜改写成该段的主要意图,或接受并重新构图 | | 时间轴漂移 | 整条时间轴后移,15 秒里约 2 秒 | 用分段;若必须秒级,把拍点写早并核实 | | **超载时丢段** | 15 秒装**四段**时只渲染了第 1 段和第 4 段——中间两段**整个跳过**,不是延迟。改成五段更短、每段事件更密之后**没有**复现 | 把 15 秒里约 4 个不同状态变化当作上限。需要更多就缩短每段、提高密度,或拆成多次请求 | ## 编译注记 - 输出 `@imageN`。绝不用方括号或拼写形式的素材标签 - 默认 `分段` - 重特效与大场面段落优先文字驱动 staging,不要喂故事板网格 - 构图参考与写出来的构图冲突时,删掉写的那份——它反正会输,只是增加噪音 ``` ## 档案从哪来 档案是对比工作的**产出**,不是它的前提。把同一份 spec 跑过多个模型**就是**这些字段被填满的方式——也就是说,一个对比矩阵是一次数据采集,它的交付物是那张填好的表,不只是那些视频。 信息量最高的单次测试:同一份 spec 分别用 `分段` 和 `秒级` 各跑一遍,量偏差,一次填满三个字段——时序遵循度、建议粒度,通常还附带一个失败模式。 ## 关联 - [portability.zh-CN.md](portability.zh-CN.md) — 编译器怎么消费这些字段 - [checklist.zh-CN.md](checklist.zh-CN.md) — 提交前检查
SHA-256: a75d8c3d6b7016343c1f3e68007e6832a8ae78aba0673ea2856e61eece9f8972