VideoCaptioner(卡卡字幕助手)使用教程:AI 一键生成高质量视频字幕
给视频配字幕一直是个麻烦事——手动打轴累、自动识别的断句又经常不通顺。VideoCaptioner(卡卡字幕助手)是一个开源免费的字幕制作工具,把语音识别、字幕断句、AI 优化和翻译整合成一条流水线,拖拽视频进去就能自动出成品字幕。
软件简介
VideoCaptioner 由开发者 WEIFENG2333 在 GitHub 上开源(仓库名 WEIFENG2333/VideoCaptioner),Windows 版打包后不到 60MB,已经集成了所有必要环境,下载解压就能用。
核心流程:语音识别 -> 字幕断句 -> AI 优化/翻译 -> 字幕视频合成

安装方式
Windows 用户(推荐)
从项目 Release 页面下载最新版安装包,或者用蓝奏盘链接下载。解压后直接运行 VideoCaptioner.exe 即可。首次运行会自动检测环境,不需要额外配置 Python 或 ffmpeg。
macOS / Linux 用户
用源码运行需要 Python 3.11 环境:
# 1. 克隆项目
git clone https://github.com/WEIFENG2333/VideoCaptioner.git
cd VideoCaptioner
# 2. 安装系统依赖(macOS)
brew install ffmpeg aria2 python@3.11
# 或 Ubuntu/Debian
# sudo apt install ffmpeg aria2 python3.11 python3.11-venv
# 3. 安装 Python 依赖
python3.11 -m venv venv
source venv/bin/activate
pip install -r requirements.txt
# 4. 运行
python main.py
使用步骤
VideoCaptioner 的界面很简单,核心操作就是拖拽视频到窗口,然后等着出结果。
第一步:拖入视频文件
支持常见视频格式(MP4、MKV、MOV 等),也支持直接拖入 B 站或 YouTube 的视频链接,软件会自动下载再处理。
第二步:配置 LLM API(可选但推荐)
软件内置了基础大语言模型(gpt-4o-mini),不配置也能用。但如果想获得更好的字幕优化和翻译效果,建议在「设置 - LLM 配置」里���写自己的 API Key。
支持的 LLM 服务商:
| 服务商 | 特点 | 推荐模型 |
|---|---|---|
| OpenAI | 质量最好 | gpt-4o-mini(经济)/ gpt-4o(高质量) |
| DeepSeek | 性价比高 | deepseek-chat |
| SiliconCloud | 国内可用 | Qwen/Qwen2.5-72B-Instruct |
| Ollama | 本地运行,完全免费 | llama3.1:8b |
第三步:配置语音识别
在「语音识别」页面选择识别引擎。软件提供几种接口:
- B 接口 / J 接口:在线免费接口,速度快,支持中英文
- 本地 Whisper:需要下载模型(软件内下载),支持 96 种语言,中文建议用 Medium 以上模型
本地 Whisper 模型占用空间参考:
| 模型 | 磁盘空间 | 说明 |
|---|---|---|
| Tiny | 75 MB | 仅用于测试 |
| Small | 466 MB | 英文效果不错 |
| Medium | 1.5 GB | 中文推荐使用 |
| Large | 2.9 GB | 效果最好 |
第四步:开始处理
拖入视频后,点击「开始任务」,软件会自动走完语音识别 -> 字幕断句 -> AI 优化/翻译 -> 字幕视频合成全流程。

核心功能详解
字幕智能断句
普通语音识别出的字幕经常是逐字输出、断句混乱。VideoCaptioner 借助 LLM 把逐字字幕重组为符合自然语言习惯的段落,让字幕阅读更流畅。
字幕纠错
自动修正专业术语、代码片段、数学公式的格式,统一人名和专有名词。如果视频中有特定领域术语,可以在「文稿匹配」里填写术语对照表,比如:
机器学习 -> Machine LearningElon Musk -> 马斯克
高质量翻译
翻译采用吴恩达提出的「翻译-反思-翻译」方法,先翻译一轮,再让大模型反思翻译结果,然后优化为更地道的表达。同时用序列模糊匹配算法保证时间轴完全一致,不会出现翻译后字幕对不上画面。
字幕样式调整
内置多种字幕样式模板:科普风、新闻风、番剧风等。支持设置主副字幕的字体、大小、颜色、边框样式、行距、位置。输出格式支持 SRT、ASS、VTT、TXT。
配置项说明
文稿匹配
在「字幕优化与翻译」页面,可以填入以下内容辅助校正字幕:
- 术语表:专业术语、人名、特定词语的修正对照表
- 原字幕文稿:视频的原有文稿或演讲稿,帮助断句更准确
- 修正要求:对字幕内容的具体要求,比如统一人称代词、规范专业术语
Cookie 配置
如果需要下载 B 站或 YouTube 需要登录��能看的视频,可以在设置里配置 Cookie。把浏览器导出的 cookies.txt 放到软件目录下即可。
实际效果参考
开发者测试过一个 14 分钟 1080P 的 TED 英文视频:
- 调用本地 Whisper 进行语音识别
- 使用 gpt-4o-mini 优化和翻译为中文
- 总耗时约 4 分钟
- LLM 消耗费用不足 0.01 元
小结
VideoCaptioner 适合以下场景:
- 做视频字幕不想手动打轴
- 需要把外语视频翻译成中文并配上字幕
- 批量处理多个视频的字幕
- 想要自由调整字幕样式和格式
开源免费、Windows 开箱即用、支持本地 Whisper 离线运行、LLM 翻译质量好,是目前视频字幕制作工具里性价比很高的选择。
项目地址:https://github.com/WEIFENG2333/VideoCaptioner 官网:https://www.videocaptioner.cn