Skip to content

stopbye/video-distillation

Repository files navigation

video-distillation

video-distillation is a Codex skill for turning videos, keyframes, screenshots, reference images, narration scripts, and short plot briefs into:

  • a Chinese video analysis package
  • a continuous action timeline
  • separated audio layers for dialogue / POV speech / narration
  • a Doubao-ready image-to-video prompt package

中文说明:

video-distillation 是一个面向 Codex 技能系统的短视频蒸馏 skill。
它的目标不是只“总结视频”,而是把视频、关键帧、参考图、旁白文案和剧情需求,整理成一份更适合图生视频模型执行的中文分析包和提示词包。

Keywords

This repository is intentionally optimized to be discoverable for queries related to:

  • video distillation
  • short video prompt
  • image to video prompt
  • Doubao prompt
  • storyboard extraction
  • motion breakdown
  • POV speech separation
  • narration separation
  • dialogue extraction
  • Chinese video analysis

中文关键词:

  • 视频蒸馏
  • 短视频提示词
  • 图生视频提示词
  • 豆包提示词
  • 分镜拆解
  • 动作拆解
  • POV 说话
  • 旁白分离
  • 对白分离

Core Capabilities

  • 观察视频并按连续时间轴拆动作
  • 绑定角色身份,避免前后段人设漂移
  • 区分角色对白、第一人称 POV 说话、旁白 / 画外音
  • 强化高风险动作核验,例如递物、摘帽、牵引、踢、咬、接触反馈
  • 将分析结果改写成可直接投喂豆包等模型的中文提示词

Install

如果你使用的是 skills CLI,优先尝试直接从 GitHub 安装:

npx skills add stopbye/video-distillation -g -y

如果你的 skills CLI 版本要求显式 skill 名,也可以尝试:

npx skills add stopbye/video-distillation@video-distillation -g -y

本地安装方式:

$CODEX_HOME/skills/video-distillation

然后在支持 skill 的环境中调用:

Use $video-distillation 观察我上传的视频,拆解剧情、动作、POV 说话、角色对白和旁白,并输出豆包可用的提示词包。

Repository Layout

.
├── SKILL.md
├── LICENSE
├── README.md
├── requirements.txt
├── .gitignore
├── agents/
│   └── openai.yaml
├── references/
│   ├── action-patterns.md
│   ├── audio-reading.md
│   ├── critical-reading.md
│   ├── identity-binding.md
│   ├── motion-continuity.md
│   └── output-template.md
└── scripts/
    └── transcribe_audio.py

What It Produces

标准输出结构:

  1. 视频内容概述
  2. 角色绑定 / 角色卡
  3. 场景设定 / 风格锚点
  4. 时间轴动作拆解
  5. 音频拆解
  6. POV 说话
  7. 旁白 / 解说
  8. 豆包提示词
  9. 不确定项

Example Queries

Use $video-distillation 观察我上传的短视频,按 2 秒一段拆动作,并区分角色对白、POV 说话和旁白。
Use $video-distillation 结合视频和角色参考图,锁定人物身份,提取剧情和镜头语言,再输出豆包图生视频提示词。
Use $video-distillation 根据视频和我提供的已知台词,核验角色到底说了什么,哪些是 POV 在说,哪些是旁白。

Notable Design Rules

  • 连续时间轴优先,不按镜头切点乱跳
  • 先锁角色,再写动作
  • 关键动作要验证 动作前 -> 接触瞬间 -> 动作后
  • 抓住牵着走 / 拖着走 / 带着移动 必须分开
  • 短口头禅、萌系 vocal tic、拟声类台词属于高风险音频节拍
  • 当 ASR 只能恢复部分音节时,要报告局限,不能误判成“角色没说话”

Dependencies

scripts/transcribe_audio.py 依赖:

  • faster-whisper

推荐安装:

pip install -r requirements.txt

如果你偏好使用现代 Python 项目配置,也可以执行:

pip install .

转写脚本示例:

python scripts/transcribe_audio.py input.mp4 --model small --language zh --output transcript.json

短口头禅、萌系台词、角色口头禅建议补一个 --initial-prompt

Limitations

  • 该 skill 更适合“有明确角色和动作线索”的短视频
  • 自动转写不是绝对真相,需要结合口型、动作时序和用户已知信息校验
  • 对极短、极轻、极高音、重叠噪声中的角色口头禅,可能只能恢复到部分音节

License

MIT

About

Codex skill for video distillation, POV/dialogue/narration separation, and Doubao-ready short-video prompts.

Topics

Resources

License

Stars

5 stars

Watchers

0 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors

Languages