pyVideoTrans

4小时前发布 1 0 0

把外语视频自动识别成字幕、AI 翻译、配音再合成新视频的本地开源工具,命令行与网页界面都能跑

所在地:
中国
语言:
中文、英文
收录时间:
2026-09-18
pyVideoTranspyVideoTrans
价格完全免费需沟通询价
平台网页版Windows客户端Mac客户端命令行其它

pyVideoTrans详细介绍

手头有两小时的英文访谈素材,下周一之前要出一版中文字幕加中文配音的成片。约束有三条:素材签了保密协议不能传第三方云服务,剪片子的机器只有一块 8G 显存的显卡,预算里没有给在线配音服务留钱。

先试了在线字幕站。十五分钟免费额度用完后开始按分钟收费,两小时素材算下来不便宜,上传这一步还直接被保密要求卡掉。又试了纯手工:用语音转文字工具出英文字幕,导出后逐句翻译,再找语音合成生成配音,最后拖进剪辑软件对时间轴。英文字幕里人名和术语错了十几处,配音时长跟原声对不上,光对齐就花掉一整天。

最后选了 pyVideoTrans。Windows 用的是预打包版,解压到纯英文路径后双击 sp.exe 启动,首次启动要等几十秒加载模块。任务被拆成四步:选素材和输出目录,挑语音识别渠道,挑翻译渠道,挑配音渠道。识别用的是内置的 faster-whisper 大模型,翻译接的是在线大模型接口,配音用开箱可用的 Edge-TTS。单文件处理时会在字幕生成后和翻译后各暂停一次,把字幕拉到右侧文本框里改人名和专业词,改完点执行继续。

能直接交付的是成片加过程中的 SRT 字幕和配音文件,字幕嵌入方式可选硬字幕、软字幕或双语。踩过的坑挺具体:显存只有 8G 时识别和配音同时跑会互相抢资源,表现是几分钟才出一句,把高级选项里的并发线程调成 1、语速和分段参数调小之后才顺畅;勾选保留背景音会先做一次人声分离,这一步在软件里是纯 CPU 运算,不调用显卡,两小时素材会明显拖长时间,官方论坛的建议是先用外部工具分离好,把人声与伴奏文件命名后放进输出目录,软件会直接读取跳过这一环。长视频偶尔还有漏句,切分算法和翻译提示词每次更新都在改这个问题。

这次只用了视频翻译一条线,pyVideoTrans 里还有独立的语音转录、批量翻译 SRT、批量为字幕配音、多角色配音和字幕格式互转几个面板,做播客转文字或者给已有字幕换语言可以直接用,不必再装第二个工具。还没试过的是声音克隆,得先本地部署 F5-TTS 或 CosyVoice 这类模型;下周准备拿一段两分钟的素材先把克隆语音跑通,再上整片。

pyVideoTrans的核心功能

  • 全自动视频翻译:选好素材、发音语言和目标语言,按语音识别、字幕翻译、配音、音视频对齐的顺序自动跑完,输出带目标语言字幕与配音的 MP4。单文件任务会在识别后与翻译后各暂停一次留出校对窗口,批量任务则连续执行不再中断。
  • AI 语音识别与转录:内置 faster-whisper、openai-whisper、FunASR、Qwen-ASR 等本地渠道,也能接字节、OpenAI、Gemini、deepgram 等在线接口。中文素材换成中文优化模型更稳,识别质量直接决定后面几步的上限,建议先用一小段素材试出合适的模型再跑全片。
  • AI 字幕翻译:可接 DeepSeek、OpenAI、Gemini、Claude、智谱、硅基流动等大模型接口,也能用 Google、微软免费翻译或本地 M2M100。勾选发送完整字幕能让长上下文模型看到全篇语境,译文更连贯;本地小模型开了这个选项容易串格式或冒出提示词。术语表功能可以固定专业词译法。
  • AI 配音合成:默认的 Edge-TTS 开箱可用,本地可换成 Qwen3-TTS、F5-TTS、ChatterBox、Piper 等,也能接 OpenAI、Azure、字节、Minimaxi 等商业接口。选完目标语言后发音人列表会自动更新,选中角色可以试听,语速、音量、音调都能按百分比微调。
  • AI 声音克隆与多角色配音:用 F5-TTS、CosyVoice、GPT-SoVITS 这类模型可以按参考音频克隆音色,多角色面板能为每行字幕单独指定发音人。做访谈和对话类素材时不用手动切音轨,官方建议克隆场景下不要开启按语义重新断句,否则参考音频提取会受影响。
  • 音视频同步控制:配音比原声长时可以加速配音、放慢视频,或者两者各承担一半;另有二次识别功能,在配音完成后重新转写一遍配音音轨,生成更贴合的时间码。放慢视频会切出大量临时片段,占用的磁盘空间可能超过原素材,处理完记得清缓存。
  • 命令行与网页界面:cli.py 支持视频翻译、语音转字幕、字幕翻译、文字转语音四类任务,参数包括任务类型、文件名、源语言与目标语言、发音角色,适合放服务器上无人值守跑批量。webui.py 是浏览器界面,可以部署在内网,也能用 Docker 起容器给同事用。
  • 辅助工具集:含人声与背景音分离、硬字幕提取、视频合并、字幕格式互转、音视频字幕合并等面板。硬字幕提取针对画面里烧死的字幕,官方单独提供了说明页,处理素材时不必再装第二个剪辑软件。

pyVideoTrans的价格详情

免费权益:

完全开源免费,采用 GPL-V3 协议,无功能限制,不需要登录或卡密验证,桌面界面、网页界面和命令行三种入口都不收费。当前主推版本 v4.12,Windows 预打包完整包约 2.7G,另有约 360MB 的补丁包可叠加到旧版本上。官网同时保留 v4.11、v4.09、v4.03 供回退。硬件方面官方标注有无英伟达显卡都能运行,但纯 CPU 跑大模型速度很慢,显存不足会直接报错,8G 显存同时跑识别与配音需要把并发调到 1,GPU 加速需自行安装 CUDA 12.8 与 cuDNN 9.x。价格与版本可能随官方调整。

收费模式:

站内不设付费档位,软件本体、更新与全部功能均不收费,官方明确未授权任何第三方渠道销售,凡需付费购买或卡密验证的版本都不是官方原版。开发者只接受小额捐赠(Ko-fi、微信、支付宝),捐赠与否不影响功能。实际成本来自两处:一是调用在线识别、翻译、配音接口时需自备账户与密钥并在第三方平台充值,密钥仅本地保存;二是本地模型对显卡与内存有要求,配置不够时处理时间会拉长。

pyVideoTrans的应用场景

  • 外语访谈做中文成片:导入素材后选发音语言和目标语言,用本地识别加在线大模型翻译,在暂停窗口里改完人名和术语再跑配音,最后嵌入双语硬字幕交付。
  • 播客批量转文字:用独立的语音转录面板一次拖入多集音频,选大模型出带时间轴的 SRT,再按需切成纯文本,中文方言素材换成中文优化模型。
  • 已有字幕换语言:手里有现成的 SRT 时,用批量翻译字幕面板保留时间轴换语言,输出单语或目标语言在上的双语版本。
  • 服务器上无人值守批量处理:在 Linux 机器上用命令行串起识别与翻译任务,文字界面不需要显示器,跑完自动关机,适合夜里处理大批素材。
  • 内网部署给团队用:用 Docker 起网页界面,同事在浏览器里上传素材和设置参数,配置和输出目录挂载到宿主机,方便统一管理。
  • 给视频换音色:拿一段自己的录音作参考,用克隆类语音合成把整段字幕配成同一个音色,再回主界面做时间轴对齐。
  • 网课素材本地化:把英文课程视频批量转成中文字幕加配音,勾选保留原始背景音乐,输出按课时分目录存放。
  • 素材保密场景:全程用本地模型做识别、翻译和配音,素材不出本机,只在个别段落需要更高质量时再手工切到在线接口。

pyVideoTrans的适用人群

  • 自媒体创作:做外语视频搬运或双语内容的人,用全自动流程出字幕和配音,对话段落交给多角色面板处理,省掉逐句对口型的时间。
  • 开发者:愿意写脚本的人可以用命令行把识别与翻译串成流水线,或者把网页界面挂到内网给团队调用,也能接自己部署的兼容接口。
  • 教师:做双语课件和慕课的老师可以在本地批量转字幕,不依赖外部平台额度,学生素材留在自己机器上处理。
  • 科研人员:处理访谈录音和田野音频时,用语音转录面板批量出字幕,遇到中文方言或小语种可以换识别模型再跑一遍。
  • 电商运营:给产品视频做多语言版本时,先用字幕翻译换语言再做配音,一次输出几套语言素材供不同站点投放。
  • 办公通用:公司内部培训、会议录像需要转写和加字幕的岗位,用本地模式处理不便外传的内容。

同类工具对比

对比维度 pyVideoTrans(本工具) VideoLingo HeyGen Rask AI Buzz
定位 本地运行的开源视频翻译与语音转录工具,同时提供图形界面、命令行与网页界面 开源视频翻译工具,重点打磨字幕切分与配音对齐 在线视频翻译与数字人视频平台,云端处理 云端视频本地化平台,面向多语言内容投放 本地运行的语音转文字与翻译小工具
核心优势 识别、翻译、配音三类渠道各接十几种,本地模型与在线接口可自由组合,流程中可暂停校对,音频不出本机 字幕断句质量不错,翻译提示词做了不少调整,配置项集中在翻译环节,长视频字幕观感好 不需要本地算力,口型同步效果好,网页操作门槛低,成片观感统一 支持的语言多,配音音色库丰富,导出流程顺畅,团队协作与项目管理做得比较完整 安装简单,识别结果可以逐条编辑,完全离线可用,占用资源少
主要短板 图形界面偏朴素,文档页之间的跳转不够成体系,纯 CPU 跑大模型慢,显存不足会直接报错 渠道接入数量少于同类,主要通过网页界面操作,部署需要自己装环境 素材需上传到云端,按分钟或额度计费,长视频成本不低,导出格式与字幕样式定制空间有限 价格偏高,素材需要上传到云,深度定制与批量脚本化的空间有限 只做转录与基础翻译,不含配音与视频合成,批量处理和多角色场景支持有限
价格 软件本体免费开源,成本只在自备的第三方接口与本地算力 开源免费,使用在线翻译接口需自备密钥 订阅制,按额度分档,另有按量计费 订阅制,按分钟数或额度分档 开源免费
适合谁 素材不便外传、又愿意花时间调参数的视频处理人员 愿意折腾部署、主要目标是做好长视频字幕的人 没有显卡、追求口型效果、素材不敏感的创作者 团队化做多语言内容投放的运营团队 只想把音视频转成文字、不需要配音的人

相关导航

暂无评论

用户投票:

none
暂无评论...