# Sol-H3：高级感与细节融合方案

已完成：47 秒带音频剪辑预览、可播放审片页、四份按 MiniMax 官方 skill 编写的 Ref2VA prompts、参考图片、8-step 推理入口和来源记录。

**状态：预览是既有素材的重新剪辑与新绘制的流程动画；尚未运行新的 Ref2VA 推理。** 当前找到的本地模型索引指向缺失的 `transformer_ref` 目录，也未找到指定的 8-step adapter。没有使用现有的 FastVideo/Ref2V 4-step 服务代替。完整错误见 `inference-preflight.json`。

## 创作判断

两版结合的是视觉语言与信息内容：保留新版的克制排版、微距材质、人物特写和开阔场景；把牛来版的流程信息重新绘制为干净的技术演示。牛角色、教室、嚎叫没有进入推荐预览。这不是把两个完整视频首尾拼接，也没有让视频模型重画成片里的所有文字。

高级感来自稳定构图、自然表面、明确光源和适度停留；细节来自能看清并听见的因果动作，例如笔尖接触纸张、墨水进入纤维、宇航员说话时的口型与呼吸。每个新增镜头只承担一个主要动作或一次简短对话。

## 47 秒剪辑预览

| 时间 | 内容 | 音频 |
|---|---|---|
| 0–17 s | 最新版开头、约 56 秒性能信息、384p → 768p | 保留原版配乐 |
| 17–23 s | 384p Draft → VAE Adapter → LTX + Sol-Attn 768p Refine | 原版配乐短段，接点淡入淡出 |
| 23–28 s | 钢笔微距，完整正常速度 | sample 原声；没有覆盖配乐 |
| 28–33 s | 宇航员驾驶舱，完整正常速度 | sample 原声；没有覆盖配乐 |
| 33–38 s | 海边咖啡双人场景，完整正常速度 | sample 原声；没有覆盖配乐 |
| 38–42 s | 原版幻想场景 | 原版配乐 |
| 42–47 s | 原版 NVIDIA / MiniMax / SANA 收尾 | 原版配乐 |

此版用于判断节奏、信息密度和原声窗口。钢笔原声提高 14 dB、咖啡馆提高 8 dB，并限制峰值；音频内容保持原样。原咖啡馆 sample 有人声，但其原 prompt 没有明确台词；自动转写结果不可靠，不能当作可交付对白或字幕。驾驶舱原 sample 没有被自动转写出语言内容。声音波形/音轨检查和 ASR 不等同于人工听感验收。

## 新生成 prompts

全部使用官方六段格式：`subject_definitions` → `summary` → `retention_analysis` → `detailed_description` → `overall_soundscape` → `non_diegetic_music`。正文英文、对白 `<d>[English] ...</d>`、角色 S1/S2 顺序固定。每份 detailed_description 为 350–500 英文词，时间与实际请求帧数一致。

| 文件 | 长度 / 帧数 | 图片顺序 | 作用 |
|---|---|---|---|
| `prompts/00-engine.prompt.txt` | 8 s / 192 | engine-layout.png, pen.png | 可选：技术抽象运动 → 钢笔材质的连贯桥段 |
| `prompts/01-macro.prompt.txt` | 5.1667 s / 124 | pen.png | 笔尖、墨水、纸纤维 + 简短旁白 |
| `prompts/02-cockpit.prompt.txt` | 5.1667 s / 124 | cockpit.png | 近景口型 + 呼吸、震动、控制台音效 |
| `prompts/03-cafe-dialogue.prompt.txt` | 7.2917 s / 175 | cafe.png | 两个清楚的说话人、自然停顿和反应 |

推荐先跑 02 和 03，验证真正缺少的明确对白和口型；01 用于第二轮材质与旁白探索。00 是另一条更连贯的开场过渡方案，包含钢笔 payoff，不应和 01 无条件叠加。选定新片段后按实际时长重新剪辑；47 秒只表示当前预览，不表示四个 prompt 的合计时长。

新写对白：

- 微距旁白：Every detail. Every sound.
- 驾驶舱：Reentry stable. We're coming home.
- 咖啡馆：Same table tomorrow? / I wouldn't miss it.
- 可选技术桥段：A smaller draft. A richer world.

技术名词、数值和品牌标识采用后期稳定排版；prompt 负责空间、材质、动作和原生音画。不要把带完整字幕的 34 秒成片作为单个推理请求。当前适配的复现 runner 仅接收参考图片，已从原 sample 提取相应图片；没有伪装成传入了视频或音频参考，也没有声称保留旧配音音色。

## 固定推理参数

- MiniMax-H3 **Ref2VA**，不是 FL2VA 或 I2V。
- LightX2V `minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors`。
- Adapter SHA-256：`9bac880b1a5d7ac052171cf6cce769f0cceaaa42ffa51de4b8e41143a2bdd2d2`。
- 实际 DiT forwards = 8；这份特定 Diffusers runner 传入 `num_inference_steps=9`，其中一个是 terminal-zero grid point，并通过实际 forward 计数断言为 8。不能把这个接口约定盲目套到其他 API。
- video/audio shift = 6 / 3；LoRA rank / alpha / scale = 128 / 8 / 1.0。
- 1344 × 768、24 FPS、原生音频；当前 1344 × 756 剪辑预览沿用原宣传片画幅。
- 每段固定不同 seed；先检查参考保真和声音，再改变 seed 做比较。

复现包 runner 已恢复并保留原文件。它的顶层 docstring 遗留“四步”字样，但实际运行路径读取 H3_NFE，并调用 nfe+1、计数断言 nfe。此 launcher 强制设置 H3_NFE=8 并验证指定 adapter 的 hash。没有修改项目现有服务。

```bash
# 先检查；请在兼容的 MiniMax-H3 Diffusers 环境中运行。
python run_inference.py \
  --model /path/to/complete/Ref2VA-diffusers \
  --adapter /path/to/minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors \
  --python /path/to/h3-env/bin/python

# 在已分配的合适 GPU 上执行；默认先生成 cockpit 和 cafe。
python run_inference.py \
  --model /path/to/complete/Ref2VA-diffusers \
  --adapter /path/to/minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors \
  --python /path/to/h3-env/bin/python --execute
```

复现包报告该单 GPU BF16 路径曾用约 157 GiB 显存。这里的影片生成环境与片中宣传的 Spark 产品运行环境是两回事。网站 samples 也不能因被剪进这部片子就称为本次 Ref2VA 8-step 新生成结果。

## 审片重点

1. 先打开 `review.html` 播放融合预览；播放器未设置 muted，仍需用户点击播放并开启设备音量。
2. 在 23–38 秒逐段听原声，判断是否该缩短或替换；咖啡馆台词优先重生。
3. 新生成结果必须核对实际 8 次 DiT、AAC 音轨、说话人口型、对白完整性、手部与硬件结构；不要仅靠 seed 或提示词格式认定成功。
4. 约 56 秒沿用网站的三次 warm resident 请求平均 56.17 秒，包括完成带音频 MP4；不是冷启动、不是实时、不是本次生成耗时。新增流程图是概念说明，不是实测推理中间帧。

## 来源

- [MiniMax 官方 H3 prompt skill](https://github.com/MiniMax-AI/MiniMax-H3/blob/main/skills/h3-prompt-writing/SKILL.md)
- [官方 Ref2VA guide](https://github.com/MiniMax-AI/MiniMax-H3/blob/main/skills/h3-prompt-writing/references/ref-en.txt)
- [新版原视频](https://huggingface.co/spaces/lawrence-cj/sol-h3-promo/resolve/main/spark-focused-v3/sol-h3-spark-focused-34s.mp4)
- [牛来原视频](https://huggingface.co/spaces/lawrence-cj/sol-h3-promo/resolve/main/sol-h3-on-spark-niu-lai-howl-ref2va8.mp4)
- [新版制作说明](https://huggingface.co/spaces/lawrence-cj/sol-h3-promo/blob/main/spark-focused-v3/README.md)：说明了仅使用统一配乐、没有使用每个 sample 原声。
- [用户指定的 Spark 网站](https://hp-l33-minimax-h3-dgx-spark.static.hf.space/sol-h3-lieflat/index.html)：流程顺序、VAE latent transfer、refiner prompt cache、性能数值。
- [8-step 复现包](https://huggingface.co/spaces/lawrence-cj/sol-h3-promo/resolve/main/sol-h3-lightx2v-ref2va8-repro-pack.zip)：恢复了另一版牛来影片的旧 prompt 和 runner，并非声称找回了用户最新两版的完整遗失 prompt。

原视频通过 timestamped contact sheets 目视分析；声音通过原声保留、音轨解码与临时 tiny.en ASR 辅助检查，没有把机器转写当成准确的人工听写。


## Rebuild this published preview

Install `av numpy pillow imageio-ffmpeg`, then run `python fetch_sources.py`, `python build_preview.py`, and `python validate.py`. The source footage is downloaded from the exact public URLs in `source-urls.json`.


## HF 媒体存储

高清预览已上传，可在原 Space 播放。由于原 Space 接近 1 GB 上限，视频与参考图片保存于经用户授权的 [同账号媒体仓库](https://huggingface.co/datasets/Lawrence-cj/sol-h3-promo-assets/tree/main/spark-premium-detail-v1)。下载复现目录时，将该目录内的 MP4 和 references 文件夹与这里的脚本放在一起。
