
pyVideoTrans详细介绍
手头有两小时的英文访谈素材,下周一之前要出一版中文字幕加中文配音的成片。约束有三条:素材签了保密协议不能传第三方云服务,剪片子的机器只有一块 8G 显存的显卡,预算里没有给在线配音服务留钱。
先试了在线字幕站。十五分钟免费额度用完后开始按分钟收费,两小时素材算下来不便宜,上传这一步还直接被保密要求卡掉。又试了纯手工:用语音转文字工具出英文字幕,导出后逐句翻译,再找语音合成生成配音,最后拖进剪辑软件对时间轴。英文字幕里人名和术语错了十几处,配音时长跟原声对不上,光对齐就花掉一整天。
最后选了 pyVideoTrans。Windows 用的是预打包版,解压到纯英文路径后双击 sp.exe 启动,首次启动要等几十秒加载模块。任务被拆成四步:选素材和输出目录,挑语音识别渠道,挑翻译渠道,挑配音渠道。识别用的是内置的 faster-whisper 大模型,翻译接的是在线大模型接口,配音用开箱可用的 Edge-TTS。单文件处理时会在字幕生成后和翻译后各暂停一次,把字幕拉到右侧文本框里改人名和专业词,改完点执行继续。
能直接交付的是成片加过程中的 SRT 字幕和配音文件,字幕嵌入方式可选硬字幕、软字幕或双语。踩过的坑挺具体:显存只有 8G 时识别和配音同时跑会互相抢资源,表现是几分钟才出一句,把高级选项里的并发线程调成 1、语速和分段参数调小之后才顺畅;勾选保留背景音会先做一次人声分离,这一步在软件里是纯 CPU 运算,不调用显卡,两小时素材会明显拖长时间,官方论坛的建议是先用外部工具分离好,把人声与伴奏文件命名后放进输出目录,软件会直接读取跳过这一环。长视频偶尔还有漏句,切分算法和翻译提示词每次更新都在改这个问题。
这次只用了视频翻译一条线,pyVideoTrans 里还有独立的语音转录、批量翻译 SRT、批量为字幕配音、多角色配音和字幕格式互转几个面板,做播客转文字或者给已有字幕换语言可以直接用,不必再装第二个工具。还没试过的是声音克隆,得先本地部署 F5-TTS 或 CosyVoice 这类模型;下周准备拿一段两分钟的素材先把克隆语音跑通,再上整片。
pyVideoTrans的核心功能
- 全自动视频翻译:选好素材、发音语言和目标语言,按语音识别、字幕翻译、配音、音视频对齐的顺序自动跑完,输出带目标语言字幕与配音的 MP4。单文件任务会在识别后与翻译后各暂停一次留出校对窗口,批量任务则连续执行不再中断。
- AI 语音识别与转录:内置 faster-whisper、openai-whisper、FunASR、Qwen-ASR 等本地渠道,也能接字节、OpenAI、Gemini、deepgram 等在线接口。中文素材换成中文优化模型更稳,识别质量直接决定后面几步的上限,建议先用一小段素材试出合适的模型再跑全片。
- AI 字幕翻译:可接 DeepSeek、OpenAI、Gemini、Claude、智谱、硅基流动等大模型接口,也能用 Google、微软免费翻译或本地 M2M100。勾选发送完整字幕能让长上下文模型看到全篇语境,译文更连贯;本地小模型开了这个选项容易串格式或冒出提示词。术语表功能可以固定专业词译法。
- AI 配音合成:默认的 Edge-TTS 开箱可用,本地可换成 Qwen3-TTS、F5-TTS、ChatterBox、Piper 等,也能接 OpenAI、Azure、字节、Minimaxi 等商业接口。选完目标语言后发音人列表会自动更新,选中角色可以试听,语速、音量、音调都能按百分比微调。
- AI 声音克隆与多角色配音:用 F5-TTS、CosyVoice、GPT-SoVITS 这类模型可以按参考音频克隆音色,多角色面板能为每行字幕单独指定发音人。做访谈和对话类素材时不用手动切音轨,官方建议克隆场景下不要开启按语义重新断句,否则参考音频提取会受影响。
- 音视频同步控制:配音比原声长时可以加速配音、放慢视频,或者两者各承担一半;另有二次识别功能,在配音完成后重新转写一遍配音音轨,生成更贴合的时间码。放慢视频会切出大量临时片段,占用的磁盘空间可能超过原素材,处理完记得清缓存。
- 命令行与网页界面:cli.py 支持视频翻译、语音转字幕、字幕翻译、文字转语音四类任务,参数包括任务类型、文件名、源语言与目标语言、发音角色,适合放服务器上无人值守跑批量。webui.py 是浏览器界面,可以部署在内网,也能用 Docker 起容器给同事用。
- 辅助工具集:含人声与背景音分离、硬字幕提取、视频合并、字幕格式互转、音视频字幕合并等面板。硬字幕提取针对画面里烧死的字幕,官方单独提供了说明页,处理素材时不必再装第二个剪辑软件。
pyVideoTrans的价格详情
免费权益:
完全开源免费,采用 GPL-V3 协议,无功能限制,不需要登录或卡密验证,桌面界面、网页界面和命令行三种入口都不收费。当前主推版本 v4.12,Windows 预打包完整包约 2.7G,另有约 360MB 的补丁包可叠加到旧版本上。官网同时保留 v4.11、v4.09、v4.03 供回退。硬件方面官方标注有无英伟达显卡都能运行,但纯 CPU 跑大模型速度很慢,显存不足会直接报错,8G 显存同时跑识别与配音需要把并发调到 1,GPU 加速需自行安装 CUDA 12.8 与 cuDNN 9.x。价格与版本可能随官方调整。
收费模式:
站内不设付费档位,软件本体、更新与全部功能均不收费,官方明确未授权任何第三方渠道销售,凡需付费购买或卡密验证的版本都不是官方原版。开发者只接受小额捐赠(Ko-fi、微信、支付宝),捐赠与否不影响功能。实际成本来自两处:一是调用在线识别、翻译、配音接口时需自备账户与密钥并在第三方平台充值,密钥仅本地保存;二是本地模型对显卡与内存有要求,配置不够时处理时间会拉长。
pyVideoTrans的应用场景
- 外语访谈做中文成片:导入素材后选发音语言和目标语言,用本地识别加在线大模型翻译,在暂停窗口里改完人名和术语再跑配音,最后嵌入双语硬字幕交付。
- 播客批量转文字:用独立的语音转录面板一次拖入多集音频,选大模型出带时间轴的 SRT,再按需切成纯文本,中文方言素材换成中文优化模型。
- 已有字幕换语言:手里有现成的 SRT 时,用批量翻译字幕面板保留时间轴换语言,输出单语或目标语言在上的双语版本。
- 服务器上无人值守批量处理:在 Linux 机器上用命令行串起识别与翻译任务,文字界面不需要显示器,跑完自动关机,适合夜里处理大批素材。
- 内网部署给团队用:用 Docker 起网页界面,同事在浏览器里上传素材和设置参数,配置和输出目录挂载到宿主机,方便统一管理。
- 给视频换音色:拿一段自己的录音作参考,用克隆类语音合成把整段字幕配成同一个音色,再回主界面做时间轴对齐。
- 网课素材本地化:把英文课程视频批量转成中文字幕加配音,勾选保留原始背景音乐,输出按课时分目录存放。
- 素材保密场景:全程用本地模型做识别、翻译和配音,素材不出本机,只在个别段落需要更高质量时再手工切到在线接口。
pyVideoTrans的适用人群
- 自媒体创作:做外语视频搬运或双语内容的人,用全自动流程出字幕和配音,对话段落交给多角色面板处理,省掉逐句对口型的时间。
- 开发者:愿意写脚本的人可以用命令行把识别与翻译串成流水线,或者把网页界面挂到内网给团队调用,也能接自己部署的兼容接口。
- 教师:做双语课件和慕课的老师可以在本地批量转字幕,不依赖外部平台额度,学生素材留在自己机器上处理。
- 科研人员:处理访谈录音和田野音频时,用语音转录面板批量出字幕,遇到中文方言或小语种可以换识别模型再跑一遍。
- 电商运营:给产品视频做多语言版本时,先用字幕翻译换语言再做配音,一次输出几套语言素材供不同站点投放。
- 办公通用:公司内部培训、会议录像需要转写和加字幕的岗位,用本地模式处理不便外传的内容。
同类工具对比
| 对比维度 | pyVideoTrans(本工具) | VideoLingo | HeyGen | Rask AI | Buzz |
|---|---|---|---|---|---|
| 定位 | 本地运行的开源视频翻译与语音转录工具,同时提供图形界面、命令行与网页界面 | 开源视频翻译工具,重点打磨字幕切分与配音对齐 | 在线视频翻译与数字人视频平台,云端处理 | 云端视频本地化平台,面向多语言内容投放 | 本地运行的语音转文字与翻译小工具 |
| 核心优势 | 识别、翻译、配音三类渠道各接十几种,本地模型与在线接口可自由组合,流程中可暂停校对,音频不出本机 | 字幕断句质量不错,翻译提示词做了不少调整,配置项集中在翻译环节,长视频字幕观感好 | 不需要本地算力,口型同步效果好,网页操作门槛低,成片观感统一 | 支持的语言多,配音音色库丰富,导出流程顺畅,团队协作与项目管理做得比较完整 | 安装简单,识别结果可以逐条编辑,完全离线可用,占用资源少 |
| 主要短板 | 图形界面偏朴素,文档页之间的跳转不够成体系,纯 CPU 跑大模型慢,显存不足会直接报错 | 渠道接入数量少于同类,主要通过网页界面操作,部署需要自己装环境 | 素材需上传到云端,按分钟或额度计费,长视频成本不低,导出格式与字幕样式定制空间有限 | 价格偏高,素材需要上传到云,深度定制与批量脚本化的空间有限 | 只做转录与基础翻译,不含配音与视频合成,批量处理和多角色场景支持有限 |
| 价格 | 软件本体免费开源,成本只在自备的第三方接口与本地算力 | 开源免费,使用在线翻译接口需自备密钥 | 订阅制,按额度分档,另有按量计费 | 订阅制,按分钟数或额度分档 | 开源免费 |
| 适合谁 | 素材不便外传、又愿意花时间调参数的视频处理人员 | 愿意折腾部署、主要目标是做好长视频字幕的人 | 没有显卡、追求口型效果、素材不敏感的创作者 | 团队化做多语言内容投放的运营团队 | 只想把音视频转成文字、不需要配音的人 |
相关导航


Targum Video

SoundView
通义听悟

场辞

会译
XiHATEK-AI






