← Files Atlas CloudARCHIVED FILE

skills/universal-video-prompt-skill/references/model-profile-schema.zh-CN.md

7.39 KB · Oct 4, 2026 · 12:26 UTC

↓ Download file

# 模型档案字段定义

档案是让这个 skill **随模型调整**而不只是描述模型的东西。本文件定义**字段**;每个模型有自己填好的一份实例。

两条规则贯穿每一项:

1. **记测量值,不记印象。** 「时序有漂移」没法用;「15 秒的片子里请求的拍点整体晚约 2 秒」可以编译成决策
2. **「未知」是合法值。** 空字段会触发一次探测;猜出来的字段会静默污染每一次编译和每一份基于它的对比

## 模板

```markdown
# 模型档案:<厂商>/<模型>

最后核实:<日期> · 核实人:<谁> · 服务:<你调的是哪个>

## 能力位层

| 字段 | 值 | 如何核实 |
|---|---|---|
| 素材寻址语法 | | |
| 素材数量上限(图 / 视频 / 音频) | | |
| 一次生成能否多镜头 | 能 / 不能 / 部分 | |
| 是否支持硬切 | 能 / 不能 | |
| 时长范围 | | |
| 分辨率选项 | | |
| 原生音频 | 原生 / 仅参考 / 无 | |
| 时序遵循度 | | |
| 建议粒度 | 不写 / 分段 / 秒级 | |
| 首帧 / 首尾帧 | | |
| 延长或接龙 | | |
| 视频编辑 | | |
| prompt 长度耐受性 | | |

## 偏置层

| 字段 | 值 | 如何核实 |
|---|---|---|
| 默认审美偏置 | | |
| 有效的反默认写法 | | |
| 无效或过冲的写法 | | |
| 负向锁行为 | | |
| 可识别的转场词汇 | | |
| 语言敏感性 | | |

## 已知失败模式

- <什么会坏、在什么条件下坏、有没有绕法>

## 编译注记

- <针对这个模型必须做的特殊处理>
```

## 字段说明

### 能力位层

**素材寻址语法** —— 绑定素材的那个确切 token。唯一必须翻译而不能用描述替代的东西。**照字面记。**

**素材数量上限** —— 分类型记,如果有总上限也记。厂商同时给出「稳定范围」和「文档上限」时分开记——稳定性通常在硬上限之前就开始下降。

**一次生成能否多镜头** —— 一次请求能否产出带切点的有序镜头?`部分` 意味着能用但不稳,要写清什么条件下会失败。

**是否支持硬切** —— 与多镜头分开。有些模型能出多个镜头,但总是用运动把它们连起来。

**时长范围** —— 以及时长是靠参数设定还是从输入推断。哪些任务类型会锁死它,也要记。

**原生音频** —— `原生` 会生成声音,`仅参考` 只接受音频输入,`无` 表示编译时应删掉音频行。

**时序遵循度** —— 记测量值,并附上测量时的片长。**方向很重要**:稳定偏晚可以靠提前写来补偿;不稳定则根本没法补偿。

**建议粒度** —— 从时序遵循度推出的结论。这是编译器实际读的那个字段。

**prompt 长度耐受性** —— 提示词变长时,这个模型会牺牲什么。实测存在极大的模型间差异:有的模型加长后开头整段丢失且质感锁被稀释,另一个模型在同样两份提示词上全部保住。

### 偏置层

**默认审美偏置** —— 不给任何风格指令时它落在哪。要具体:`磨皮美颜脸`、`CG 感表面`、`过饱和的调色`。这就是反默认写法要打的东西。

**有效的反默认写法** —— 在**这个**模型上实测让输出移动了的写法。

**无效或过冲的写法** —— 同样有价值,而且是最常被跳过的字段。过冲的写法比毫无作用的写法更糟,而这里正是记录「从别的模型搬来的技巧反而起了反作用」的地方。

**负向锁行为** —— 负向会被尊重吗?哪一类会失效?

**可识别的转场词汇** —— 哪些具名转场不加限定就能落地。其余的都需要术语 + 描述双写。

**语言敏感性** —— 提示词语言会改变结果吗?哪种语言最强?某个术语只在一种语言里生效,也记下来。

## 填好的示例:`bytedance/seedance-2.0`

```markdown
# 模型档案:bytedance/seedance-2.0

最后核实:2026-08-03 · 服务:Atlas Cloud

## 能力位层

| 字段 | 值 | 如何核实 |
|---|---|---|
| 素材寻址语法 | `@image1`、`@image2`… | 生成实测 |
| 素材数量上限 | 9 张图 | 厂商文档 |
| 一次生成能否多镜头 | 能——带切点的有序段落 | 15 秒多段生成 |
| 时长范围 | 4–15s | 厂商文档 |
| 原生音频 | 有 | 开启音频的生成 |
| 时序遵循度 | 15 秒的片子里请求拍点**整体晚约 2 秒**;段落**顺序稳** | 对着带时间戳的提示词做的受控 15 秒实测 |
| 建议粒度 | **分段** | 由上一行推出 |
| prompt 长度耐受性 | **高。** 加长版本保住了手、开场变形、手绘质感,还吃下了新增拍点 | 同一份 spec 的 v3 |

## 偏置层

| 字段 | 值 | 如何核实 |
|---|---|---|
| 默认审美偏置 | 镜头先验很强;稀疏提示词理解得好,会合理即兴 | 与过度指定版本做 A/B |
| 有效的反默认写法 | **按工具命名,不要命名抽象属性。** `蜡笔/彩铅/粗笔刷,看得见排线方向、涂色不均、毛边` 给出了真正的手绘笔触 | 同一份手绘 VFX spec 的受控 A/B |
| 无效或过冲的写法 | **`保持平面图形、绝不写实` —— 被精确满足、且毫无用处。** 模型用光滑的霓虹管矢量描边加均匀填充满足了它:平面,但完全不手绘。在同一份 spec 上只把这一条锁换成工具名,结果直接反转 | 同上 |
| 无效或过冲的写法 | **喂故事板网格过度指定,比纯文字 staging 更差** —— 会压掉让重特效镜头成立的运镜先验 | 同一段落的 A/B |
| 负向锁行为 | 会被尊重。前置 | 迭代 |
| 参考图与文字的优先级 | **图赢。** 构图参考会覆盖写出来的构图 | 迭代 |

## 已知失败模式

| 症状 | 细节 | 处理 |
|---|---|---|
| 小字出错 | UI 标签与招牌出现字符级错误,小字乱码 | 需要完全准确的文字走后期 |
| 列表项漏画 | 枚举的菜单项只画出一部分 | 减少条目数,或文字走后期 |
| 运镜被忽略 | 写明的运镜被跳过,段落其余部分正常 | 把运镜改写成该段的主要意图,或接受并重新构图 |
| 时间轴漂移 | 整条时间轴后移,15 秒里约 2 秒 | 用分段;若必须秒级,把拍点写早并核实 |
| **超载时丢段** | 15 秒装**四段**时只渲染了第 1 段和第 4 段——中间两段**整个跳过**,不是延迟。改成五段更短、每段事件更密之后**没有**复现 | 把 15 秒里约 4 个不同状态变化当作上限。需要更多就缩短每段、提高密度,或拆成多次请求 |

## 编译注记

- 输出 `@imageN`。绝不用方括号或拼写形式的素材标签
- 默认 `分段`
- 重特效与大场面段落优先文字驱动 staging,不要喂故事板网格
- 构图参考与写出来的构图冲突时,删掉写的那份——它反正会输,只是增加噪音
```

## 档案从哪来

档案是对比工作的**产出**,不是它的前提。把同一份 spec 跑过多个模型**就是**这些字段被填满的方式——也就是说,一个对比矩阵是一次数据采集,它的交付物是那张填好的表,不只是那些视频。

信息量最高的单次测试:同一份 spec 分别用 `分段` 和 `秒级` 各跑一遍,量偏差,一次填满三个字段——时序遵循度、建议粒度,通常还附带一个失败模式。

## 关联

- [portability.zh-CN.md](portability.zh-CN.md) — 编译器怎么消费这些字段
- [checklist.zh-CN.md](checklist.zh-CN.md) — 提交前检查

SHA-256: a75d8c3d6b7016343c1f3e68007e6832a8ae78aba0673ea2856e61eece9f8972