本项目把本地长视频分块转成带时间戳的中文文字稿,并支持断点续转。附带固定间隔抽帧工具,便于结合画面校对股票、课程、会议等专业内容。
- 文件或文件夹批量转录。
- 长视频分块处理,单块失败不必整场重来。
- 显卡不可用时自动回退到处理器。
- 可传入领域术语提示,减少专业名词误识别。
- 输出完整文字稿、分块稿和处理记录。
- 可按固定间隔抽取视频画面。
python -m venv .venv
.\.venv\Scripts\Activate.ps1
pip install -r requirements.txt首次使用会下载所选语音识别模型。
python transcribe_video.py "D:\课程\第一课.mp4" --output outputs --model mediumpython transcribe_video.py "D:\课程" --output outputs --model large-v3 --chunk-minutes 10专业课程可以准备一个 UTF-8 文本词表:
python transcribe_video.py "D:\课程" --prompt-file terms.txtpython extract_frames.py "D:\课程\第一课.mp4" --output frames --interval 300语音识别会产生错字,专业术语、股票名称、数字、买卖动作和学员问答都需要结合音频与画面复核。本项目不包含任何第三方课程视频或转录内容。
采用 MIT 许可。