用 WorkBuddy 做 AI 漫剧做到第二部时,卡在一个老问题上:分镜、出图都顺了,但配音库里找不到合适的中文 TTS,装配成片时 Flova 那边提示没有可用的配音技能。 后来我试了另一条路:让配音在本地干,WorkBuddy 只管装配。我电脑装了 Python,用的是微软 edge-tts(免费、不限量、效果接近真人)。关键套路:1. 配音脚本化:把剧本里每句台词按【角色+镜号】整理成清单,一个脚本循环调用 edge-tts,按镜号命名输出 mp3(镜2_苏晚.mp3、镜3_顾行舟.mp3),Flova 装配时直接对位放时间轴,不用手工拼接
市面上的 TTS 工具很多,但真正适合视频旁白和批量配音的工具,关键不只是“能不能把文字读出来”,而是能不能把后面的工作一起做好:文稿怎么拆分、音频怎么对应、句子之间怎么停顿、字幕能不能直接用、批量文件能不能一次导出 三种模式,按你的工作方式生成普通模式适合最简单的全文配音。把文章、脚本或旁白粘贴到左侧输入框,点击生成即可得到一个完整音频,不要求分页,也不会因为普通换行就强制拆成多个文件。 它适合视频旁白、影视解说、短视频脚本、播客文稿、课程配音、语言学习和批量音频素材制作。 如果你正在寻找“TXT 每行生成一个 MP3”“逐页生成配音”“句间停顿加 SRT 字幕”的 Windows 工具,欢迎试试 v1.4.0。 #EdgeTTS #语音合成 #AI配音 #视频旁白 #批量配音 #SRT字幕 #开源软件 #Windows工具 #Python项目
yum -y install gcc gcc-c++ autoconf automake make
今天我们将给大家介绍如何使用Lighthouse轻量服务器搭建一个属于自己的在线视频配音工具,可以将文案制作为mp3文件并且生成对应的字幕视频,以便大家在制作视频的过程中方便地为自己的视频添加自然逼真的配音 推荐同学们买一台作为学习使用,用来部署晓晓配音完全绰绰有余 image.png 购买完成后我们可以在控制台重置其系统为Ubunut+Docker专版,由于此系统自带了Docker环境,我们上手就能立刻开始部署 我们需要在防火墙放行对应的端口,推荐一次性开一个范围的端口,这样我们在部署服务的时候就可以不用每次都到控制台编辑规则了 20220414190405.png 登录我们的轻量服务器,然后在任意目录克隆晓晓配音的源代码 ,因此晓晓配音的链接有效期并不长,生成的mp4和mp3文件都是定时过期的 mkdir /tts_storage 然后,我们可以使用-v 参数将此目录作为缓存挂载到容器内部,同时使用-e 传递可用的端口号给容器服务使用 然后使用docker logs查看容器服务是否正常开启 docker logs ms_tts 当看到服务顺利监听到8019端口后,部署就完成了 run.png 最后我们就可以通过ip端口的方式访问晓晓配音服务了
剧本大概是这样:镜头时间画面旁白/台词10-6秒黑夜,古旧客栈外,牌匾"仁义馆"旁白:"这间客栈,死了很多人。"26-14秒室内,门缝中虎爪伸入旁白:"半夜,门自己开了。一只老虎走了进来。" 第四步:配音配音用了edge-tts,完全免费,本地跑。 9段配音分轨导出,每条单独存mp3,方便后期剪辑的时候细调对齐。这里有个经验:古风短剧的旁白慢一点反而更有味道。不要赶。给观众留出看画面的时间。第五步:剪辑合成剪辑用的是剪映,免费的。 旁白比角色对话好控。 角色对话要做口型同步,AI目前的口型对齐效果还是不太稳定。要么对不上,要么对了但表情僵硬。旁白不存在这个问题。我的策略是:关键台词用角色原声,其余用旁白推进。3. 配音语速要慢。 古风题材,旁白慢0.1-0.2倍,氛围感翻倍。女声也慢一点,温柔感更足。6. 先出粗剪版,再迭代。 第一版丑没关系,能跑通全流程就是胜利。我的v1版粗糙得很,但v6版就明显能看了。
面向影视解说、短剧多角色、课件配音等场景,提供API集成代码与轻量工具验证方案,助你快速构建配音能力在开发智能语音应用、批量课程配音、短视频自动解说时,TTS(文本转语音)是一项基础能力。 2026年,腾讯云语音合成(TTS)凭借国内节点稳定、中文自然度高等优势,成为许多开发者的选择之一;而叮叮配音、配朵朵、媒小三配音等轻量工具则可在前期验证阶段大幅降低试错成本。 ,为API的voice_type选型提供参考2.2配朵朵——写稿+配音+字幕一体化平台:网页+微信小程序免费额度:每日登录送免费时长(约3-5分钟视频)音色:1000+,按“悬疑解说”“史诗旁白”“电竞解说 pythonfrompydubimportAudioSegmentrole_voice={"小明":1002,#青年男声"老师":1003,#成熟男声"旁白":1004#女声叙述}defgenerate_multi_role 编写批量生成脚本利用SSML控制停顿、语速,提升旁白质量多角色项目自行解析剧本并组合多voice六、总结2026年,开发者无需在“全人工”与“全API”之间二选一。
最近重新整理短视频解说项目时,发现自己前期在AI配音上踩过不少坑。一开始总觉得:只要音色够像真人,视频听起来应该就不会有问题。 但真正做了一段时间后才发现,很多播放数据差的视频,并不是剧情不行,而是:旁白让人听着“很累”。尤其影视解说、悬疑旁白、小说推文这种内容,一旦AI配音节奏不对,观众前几秒就会直接划走。 后面连续调整了几十条内容后,我发现之前踩得最严重的坑,其实并不是模型,而是:“把AI配音当成真人录音去用。” 主要测试:男声风格停顿节奏情绪强度多角色语气目前比较常用的试听方案,包括:叮叮配音配朵朵媒小三配音主要目的不是正式生产。 而是提前确认:哪种voice_type更适合剧情哪种节奏更适合悬疑旁白哪种停顿更自然有时候同一篇文案,仅仅换一个音色,视频代入感都会完全不同。
为了让观众欣赏其他语言的电影,历史上有这样一些主流译制手段: 1 配音 将原片台词翻译后由配音演员模拟原片的情感与状态读出,用配音音轨代替原片的台词音轨,配音的声音尽量与画面中演员的嘴唇动态吻合 观众听不到画面中演员的声音,而是配音演员的声音。 2 字幕 将原片台词翻译后加到电影画面中。观众听到的所有声音是原片的声音,但需要阅读画面中的文字来理解台词和内容。 3 旁白 旁白是把原片台词讲解出来,进行诚实的翻译。旁白声音的时间控制并不与原片的声音完全同步,只是大致同步。 这种手段像是配音与字幕的中和,虽然是用声音表现,但并不模拟原片台词的情感与状态,也完全不做「对口型」的努力。观众能听到原片的台词声音,但是旁白一开口,原片的音量就会调小,被旁白的声音盖过。
前段时间帮朋友整理一批有声书内容时,我重新跑了一遍现在常见的AI配音流程。最大的感受就是:现在做有声书,最耗时间的已经不是“录音”。而是:文本整理角色区分长音频生成停顿调整字幕与时间轴尤其长篇内容。 不过真正开始做长文本后,也会发现:有声书和普通短视频配音,完全不是一个难度。一、长文本配音,最容易翻车的其实是“节奏”刚开始做长内容时,我以为只要音色自然就够了。 例如:剪映AI配音魔音工坊讯飞配音配朵朵叮叮配音媒小三配音不同方案在:男声稳定性情绪推进长文本节奏多角色切换上的差异会比较明显。尤其有些旁白刚开始很惊艳,但连续听半小时后会明显疲劳。 四、多角色配音,现在开始越来越实用以前AI有声书最大的问题之一,就是:所有角色一个语气。 现在一些方案已经开始支持:多角色voice_type情绪切换对话式生成最近测试角色旁白时,我会先单独试听:男主语气女主节奏老人声线情绪段变化有些轻量方案在前期试听时会更方便。
媒小三配音是在长文本圈子里先火起来的。它的断句逻辑不是按标点硬切,而是跟着语义走,角色对话、旁白叙述能自动区分,几十万字的稿子扔进去也不卡。 叮叮配音微信小程序直接搜,完全免费,不限字数不限时长。5000字的文案30秒出稿,断句准确率在免费工具里排前列,多音字还能单独标。没有多角色能力,但单人旁白的长文本配音,它就是零成本最优解。 写稿、配音、字幕一条线跑通,AI生成的文案直接进配音环节,断句在生成阶段就对齐了,不用来回倒腾。音色按场景分好类,"悬疑男声""温柔女声"直接选,日更博主用它能把效率拉满。 ,够用,但仅限于够用说到底,剪映内置配音没变,变的是观众的耳朵。 这个趋势还在加速,下一个被淘汰的,可能不只是配音工具本身。
于是我做了一个决定:自己造一条"童话视频生产线",让AI画绘本、AI念旁白、AI配音乐,最后成品直接发到抖音账号上,攒一个属于自己孩子的"睡前故事专辑"。 一个晚上下来,这条生产线产出了16部安徒生童话视频(竖屏9:16,带配音、带原创配乐),其中7部已经自动发布到抖音。下面把整条流水线拆开讲。 二、先看全景:五个环节,一条流水线展开代码语言:TXTAI代码解释故事文本──►AI画插画──►AI配音──►AI合成配乐──►渲染成片──►自动发抖音(竖屏插画)(情感旁白)(原创悲伤钢琴曲)(1080 四、环节二:让故事"开口说话"——配音的情绪是调出来的配音用的是edge-tts(微软Edge浏览器同款免费TTS),音色选zh-CN-XiaoxiaoNeural(晓晓)。 +0.6秒呼吸留白;逐页用ffmpeg编码h264+aac分段渲染,最后concat拼接、amix把旁白和BGM混成一条音轨。
TTS 配音缺人味:现有 TTS 通常声音机器化,难以精准还原个人风格。 跨语境风格一致性弱:使用素材组合时口音、语速、语气风格差距大。 想配音但找不到匹配情感或口音的主播?传统 TTS 通常需要大量样本。视频素材需补充旁白/音效提示,但不想重新录制。 VoiceCraft 可在原录音片段位置自动插入/删除/替换语句,核心亮点是 零样本(zero‑shot)克隆声音,只需几秒参考录音,就能实现自然配音!这种体验对内容创作者简直太友好了。 核心功能功能描述应用举例零样本语音编辑在已有录音中插入/删除内容,效果自然纠错录音稿、补充遗漏零样本 TTS以新口音/风格合成完全新语音视频配音、广告旁白高质量自然度人耳几乎无法分辨真实与合成语音自然度可用于正式出版音频或播客移动端 :克隆原配音风格,在无重录的情况下修改字幕内容 广告和旁白:导入参考音,仅插入特定文字即可生成新版本 AI 科研实验:开源模型让研究者可以尝试新思路对比分析项目零样本编辑零样本 TTS本地部署开源自然度
最近在做短视频自动旁白和小说推文生成时,重新整理了一遍目前常见的中文TTS(文本转语音)方案。 目前测试下来,像:叮叮配音配朵朵媒小三配音剪映AI配音这类封装型工具,在前期验证阶段会明显提高效率。尤其在处理:男声旁白多角色对话悬疑解说科普类视频时,直接试听会比反复调API参数更直观。 3.多角色场景切换在测试短剧旁白时,又遇到一个问题:角色之间缺少区分。后来会先在试听层测试不同voice_type,再进入API阶段。 五、ffmpeg拼接与字幕处理实际做自动旁白时,仅生成音频还不够。 尤其中文旁白场景里,真正影响听感的,很多时候已经不是模型本身。而是:断句停顿语速情绪强度这些细节。
直到我最近翻到一个开源小工具——jianying-editor,它能让你用Python脚本,一句话就把素材、字幕、配音、BGM全塞进剪映草稿里。 Jianying Editor 这个技能 指令 2:豆包你好,我给你素材,你给我用剪映剪辑一个既有网感又能获得高播放还能看起来剪辑技术很厉害的视频,要达到百万剪辑师的水平,开篇设计强吸引力钩子;根据素材内容精准搭配配音 按以前的做法,我得: 打开剪映,新建竖屏项目 一段一段导入7个视频 在两段视频之间加转场 给每段视频打字幕 找一首BGM拖进去 用AI配音把旁白念出来 调整音量、对齐时间轴 光想想就困了。 就像你跟剪辑师说"帮我把这7段视频拼起来,加个BGM,配个女声旁白",它替你跑腿。 它能干的事,比我演示的多 我上面只是用了最基础的功能。 发现还挺能打: 素材处理 导入视频、图片、音频,自动识别类型 支持画中画、多轨道叠加 webm自动转成剪映能认的mp4 字幕和文字 加普通字幕、花字(带渐变描边那种) 富文本高亮关键词 导入SRT字幕文件 配音
doc-to-video:将 Markdown 一键变成专业视频 让 AI Agent 自动把技术文档变成带配音旁白的 1080p 视频,零门槛,10 分钟搞定。 一句话介绍doc-to-video 是一个 OpenClaw/QClaw Agent Skill,能把任意 Markdown 技术文档自动转换成带自然人声旁白的专业视频。 传统的视频制作流程:写旁白脚本 → 人工配音 → 剪辑 → 加字幕 → 导出即使有工具,也需要手动操作,过程碎片化doc-to-video 把这个流程压缩成一条命令: 音视频帧级同步这是视频配音最常见也最难解决的问题。大多数方案靠估算帧数,导致音视频不同步。 A:macOS 可用系统语音:say -v Tingting -r 175 "旁白内容",然后 ffmpeg -i audio.aiff audio.mp3。
,男主、女主、配角、旁白声音高度趋同,观众无法通过声音区分人物;部分在线服务会上传全部剧本文本,存在原创剧本泄露风险;批量批量生成几十集漫剧的时候,在线接口限流会直接打断量产流水线。 千套音色素材库的价值,就是为上百个虚拟角色提供足够丰富的声线备选,覆盖少年、青年男女、中老年、萝莉、御姐、旁白、反派等不同声线风格。 -**旁白叙事专用素材**语速平稳,吐字清晰,适合故事开篇、剧情过渡旁白,不适合角色对话。 /voice_lib/male_evil_011.wav","旁白":". ,{"role":"旁白","text":"夜色降临,二人向着山谷深处前行。"}]#音频输出保存目录OUTPUT_AUDIO_FOLDER=".
一、前言 在现在很多自媒体平台的剧情类短视频创作中,多角色配音是核心环节但痛点显著:真人配音成本高、周期长,通用 TTS 工具缺乏角色区分度,多语言 /多情绪适配性差,且难以批量处理剧本、 该系统以 SpeechT5 为核心引擎,支持中英文多角色配音,覆盖 “剧本解析→语音合成→音频拼接→字幕生成→项目报告” 全流程,还提供 Web 可视化界面与批量处理能力,完全适配自媒体小团队的配音需求 旁白: 直接文本视为旁白 # 时长估算算法:基于字符数和内容复杂度 duration = len(text) * 0.12 # 每个字符约0.12秒 if any(char 主要执行流程完整实例流程主要步骤:系统初始化:创建配音系统实例,设置输出目录角色配置:加载默认角色(小明、小红、老师、旁白等)剧本处理:解析示例剧本,识别角色对话和音效标记语音生成:为每个角色台词生成语音文件音频拼接 [音效] portal_open 旁白: 于是,一段奇妙的冒险开始了...
涵盖API集成与人工操作场景,实测数据与代码示例,助你快速构建配音能力在开发智能语音交互、批量课程配音、开源项目演示等场景时,TTS(文本转语音)是基础能力之一。 一、开发者的两类配音场景场景类型典型任务技术诉求API自动化批量生成课程音频、智能客服、实时旁白稳定API、低延迟、可编程、成本可控人工轻量单条视频配音、字幕生成、临时应急界面简单、免费或低门槛、音质够用两类场景并不互斥 电影预告”“史诗旁白”“电竞解说”分类附加功能AI写作、音频转文字(导出SRT字幕)、视频转文字、格式转换生成速度约1分钟/次多角色能力手动切换不同音色(分条录制)技术特点无需编程,每日免费额度足够日更在开发流程中的价值 免费试用,零成本完成复杂配音场景的效果验证。 建议采用分层策略:前期:利用轻量工具(配朵朵、叮叮配音、媒小三配音)的免费额度完成需求验证与参数调优。后期:对于规模化生产场景,接入腾讯云TTS等云API实现自动化。
面向开发者,基于2026年5月实测数据,对比三款国产轻量工具(配朵朵、叮叮配音、媒小三配音)与云端API的适用场景,提供从需求验证到批量生产的完整路径。附成本参考与代码示例。 在开发视频自动配音、短剧角色生成、智能语音交互等系统时,TTS(文本转语音)是基础能力之一。 月无超出后单价约1.3元/千字0.10元/千字约2.1元/千字0.10元/千字国内直连✅✅❌需代理❌需代理SSML支持支持完整基础基础流式合成WebSocket✅✅✅选型参考:对延迟极度敏感(实时对话、直播旁白 python#伪代码示例frompydubimportAudioSegmentrole_voice={"小明":"zh_male_young","老师":"zh_male_deep","旁白":"zh_female_narrator 轻量人工工具(配朵朵、叮叮配音、媒小三配音)提供了零门槛的验证手段,云端API则支撑了规模化生产。
:"这一场比赛最关键的 10 个回合" 直播带货解说:"上一场 XX 主播翻车现场" 纪录片解说:"这部 BBC 纪录片你只需要看这 5 分钟" 解说二创的内容公式很简单:长素材 → 高密度切片 → 旁白解说 但每一步在传统人工剪辑里都极其耗时: 看完原素材:1 小时素材至少要看 1.5 小时(要做笔记); 选切片:3~5 小时找出"值得讲"的 8~15 个段落; 写解说稿:2~4 小时写一份 1500~2500 字旁白 结合 ASR、字幕压制、AI 配音、智能拆条等模块,一个人就能跑通"工业化解说工厂"。 60 分钟 输入计费:60 × 3 = 180 元 预期输出:约 12 分钟解说成片 这一接口的价值不是简单的"剪辑工具",而是把"看素材+选切片+写解说稿+对轴"这四件事打包完成,直接输出"含解说旁白 Step 4|AI 配音:把"解说稿"变成"解说人声" AI 解说二创输出的"解说稿"可以接 AI 配音。