用 WorkBuddy 做 AI 漫剧做到第二部时,卡在一个老问题上:分镜、出图都顺了,但配音库里找不到合适的中文 TTS,装配成片时 Flova 那边提示没有可用的配音技能。 后来我试了另一条路:让配音在本地干,WorkBuddy 只管装配。我电脑装了 Python,用的是微软 edge-tts(免费、不限量、效果接近真人)。关键套路:1. 配音脚本化:把剧本里每句台词按【角色+镜号】整理成清单,一个脚本循环调用 edge-tts,按镜号命名输出 mp3(镜2_苏晚.mp3、镜3_顾行舟.mp3),Flova 装配时直接对位放时间轴,不用手工拼接
指标实测数据首包延迟(国内)300-400ms(流式)中文自然度9/10(神经拟人模型)定价新用户试用额度,按量低至1.2元/千字免费层新用户有免费试用额度(具体以官网为准)SSML支持实时场景WebSocket ,为API的voice_type选型提供参考2.2配朵朵——写稿+配音+字幕一体化平台:网页+微信小程序免费额度:每日登录送免费时长(约3-5分钟视频)音色:1000+,按“悬疑解说”“史诗旁白”“电竞解说 :1300+,含20种情绪标签(冷笑、哽咽、怒吼等)核心能力:自动识别剧本角色并分配不同声线;10秒声音克隆用途:验证短剧多角色映射方案,测试克隆效果三、多角色短剧配音的自动化实现路径A:人工精调(轻量工具 final+=AudioSegment.from_mp3(io.BytesIO(audio_data))final.export("final.mp3",format="mp3")四、成本参考(月生成10 -声线映射规模化生产阶段接入腾讯云TTS编写批量生成脚本利用SSML控制停顿、语速,提升旁白质量多角色项目自行解析剧本并组合多voice六、总结2026年,开发者无需在“全人工”与“全API”之间二选一
市面上的 TTS 工具很多,但真正适合视频旁白和批量配音的工具,关键不只是“能不能把文字读出来”,而是能不能把后面的工作一起做好:文稿怎么拆分、音频怎么对应、句子之间怎么停顿、字幕能不能直接用、批量文件能不能一次导出 三种模式,按你的工作方式生成普通模式适合最简单的全文配音。把文章、脚本或旁白粘贴到左侧输入框,点击生成即可得到一个完整音频,不要求分页,也不会因为普通换行就强制拆成多个文件。 它适合视频旁白、影视解说、短视频脚本、播客文稿、课程配音、语言学习和批量音频素材制作。 如果你正在寻找“TXT 每行生成一个 MP3”“逐页生成配音”“句间停顿加 SRT 字幕”的 Windows 工具,欢迎试试 v1.4.0。 #EdgeTTS #语音合成 #AI配音 #视频旁白 #批量配音 #SRT字幕 #开源软件 #Windows工具 #Python项目
剧本大概是这样:镜头时间画面旁白/台词10-6秒黑夜,古旧客栈外,牌匾"仁义馆"旁白:"这间客栈,死了很多人。"26-14秒室内,门缝中虎爪伸入旁白:"半夜,门自己开了。一只老虎走了进来。" 第四步:配音配音用了edge-tts,完全免费,本地跑。 9段配音分轨导出,每条单独存mp3,方便后期剪辑的时候细调对齐。这里有个经验:古风短剧的旁白慢一点反而更有味道。不要赶。给观众留出看画面的时间。第五步:剪辑合成剪辑用的是剪映,免费的。 旁白比角色对话好控。 角色对话要做口型同步,AI目前的口型对齐效果还是不太稳定。要么对不上,要么对了但表情僵硬。旁白不存在这个问题。我的策略是:关键台词用角色原声,其余用旁白推进。3. 配音语速要慢。 古风题材,旁白慢0.1-0.2倍,氛围感翻倍。女声也慢一点,温柔感更足。6. 先出粗剪版,再迭代。 第一版丑没关系,能跑通全流程就是胜利。我的v1版粗糙得很,但v6版就明显能看了。
今天我们将给大家介绍如何使用Lighthouse轻量服务器搭建一个属于自己的在线视频配音工具,可以将文案制作为mp3文件并且生成对应的字幕视频,以便大家在制作视频的过程中方便地为自己的视频添加自然逼真的配音 推荐同学们买一台作为学习使用,用来部署晓晓配音完全绰绰有余 image.png 购买完成后我们可以在控制台重置其系统为Ubunut+Docker专版,由于此系统自带了Docker环境,我们上手就能立刻开始部署 我们需要在防火墙放行对应的端口,推荐一次性开一个范围的端口,这样我们在部署服务的时候就可以不用每次都到控制台编辑规则了 20220414190405.png 登录我们的轻量服务器,然后在任意目录克隆晓晓配音的源代码 ,因此晓晓配音的链接有效期并不长,生成的mp4和mp3文件都是定时过期的 mkdir /tts_storage 然后,我们可以使用-v 参数将此目录作为缓存挂载到容器内部,同时使用-e 传递可用的端口号给容器服务使用 然后使用docker logs查看容器服务是否正常开启 docker logs ms_tts 当看到服务顺利监听到8019端口后,部署就完成了 run.png 最后我们就可以通过ip端口的方式访问晓晓配音服务了
免费订阅,与10万+技术人共享升级秘籍! VoiceCraft 是由德克萨斯大学奥斯汀、Meta FAIR、Rembrand 等团队合作推出的零样本语音编辑与 TTS(文本转语音)开源项目。 TTS 配音缺人味:现有 TTS 通常声音机器化,难以精准还原个人风格。 跨语境风格一致性弱:使用素材组合时口音、语速、语气风格差距大。 想配音但找不到匹配情感或口音的主播?传统 TTS 通常需要大量样本。视频素材需补充旁白/音效提示,但不想重新录制。 核心功能功能描述应用举例零样本语音编辑在已有录音中插入/删除内容,效果自然纠错录音稿、补充遗漏零样本 TTS以新口音/风格合成完全新语音视频配音、广告旁白高质量自然度人耳几乎无法分辨真实与合成语音自然度可用于正式出版音频或播客移动端 :克隆原配音风格,在无重录的情况下修改字幕内容 广告和旁白:导入参考音,仅插入特定文字即可生成新版本 AI 科研实验:开源模型让研究者可以尝试新思路对比分析项目零样本编辑零样本 TTS本地部署开源自然度
doc-to-video:将 Markdown 一键变成专业视频 让 AI Agent 自动把技术文档变成带配音旁白的 1080p 视频,零门槛,10 分钟搞定。 一句话介绍doc-to-video 是一个 OpenClaw/QClaw Agent Skill,能把任意 Markdown 技术文档自动转换成带自然人声旁白的专业视频。 传统的视频制作流程:写旁白脚本 → 人工配音 → 剪辑 → 加字幕 → 导出即使有工具,也需要手动操作,过程碎片化doc-to-video 把这个流程压缩成一条命令: 音视频帧级同步这是视频配音最常见也最难解决的问题。大多数方案靠估算帧数,导致音视频不同步。 A:macOS 可用系统语音:say -v Tingting -r 175 "旁白内容",然后 ffmpeg -i audio.aiff audio.mp3。
一、开发者的两类配音场景场景类型典型任务技术诉求API自动化批量生成课程音频、智能客服、实时旁白稳定API、低延迟、可编程、成本可控人工轻量单条视频配音、字幕生成、临时应急界面简单、免费或低门槛、音质够用两类场景并不互斥 2.1腾讯云TTS核心参数指标实测数据首包延迟300–400ms(流式合成)音质评分9/10(神经拟人模型)定价按量计费,低至1.2元/千字(实际以官网为准)免费层新用户有试用额度(具体请参考官方活动) 电影预告”“史诗旁白”“电竞解说”分类附加功能AI写作、音频转文字(导出SRT字幕)、视频转文字、格式转换生成速度约1分钟/次多角色能力手动切换不同音色(分条录制)技术特点无需编程,每日免费额度足够日更在开发流程中的价值 (冷笑、哽咽、怒吼、撒娇等)多角色能力自动识别剧本角色对话并分配不同声线声音克隆支持(5-10秒录音克隆,阿里达摩院技术)生成速度约1分钟/次在开发中的应用:验证多角色配音的角色-声线映射方案,确定最佳组合后迁移到 五、成本参考(月生成10万中文字)方案月成本备注叮叮配音0元完全免费配朵朵(免费层)0元每日免费时长覆盖媒小三配音(试用)0元免费试用含全部功能腾讯云TTS约120-150元具体以官网定价为准AzureTTS
为了让观众欣赏其他语言的电影,历史上有这样一些主流译制手段: 1 配音 将原片台词翻译后由配音演员模拟原片的情感与状态读出,用配音音轨代替原片的台词音轨,配音的声音尽量与画面中演员的嘴唇动态吻合 观众听不到画面中演员的声音,而是配音演员的声音。 2 字幕 将原片台词翻译后加到电影画面中。观众听到的所有声音是原片的声音,但需要阅读画面中的文字来理解台词和内容。 3 旁白 旁白是把原片台词讲解出来,进行诚实的翻译。旁白声音的时间控制并不与原片的声音完全同步,只是大致同步。 这种手段像是配音与字幕的中和,虽然是用声音表现,但并不模拟原片台词的情感与状态,也完全不做「对口型」的努力。观众能听到原片的台词声音,但是旁白一开口,原片的音量就会调小,被旁白的声音盖过。
这里推荐几个GitHub上热门、好用的配音/语音合成/语音克隆项目,有通用TTS、语音克隆、视频配音、流式/轻量等不同需求的。 ▌1. YouDub(⭐ 1.2k+) 地址:https://github.com/liuzhao1225/YouDub 功能: 自动:YouTube视频 → 语音识别 → 翻译 → 克隆原UP主音色 → 中文配音 VideoLingo(⭐ 2.5k+) 地址:https://github.com/Huanshere/VideoLingo 功能: Netflix级字幕+配音一体化 支持GPT-SoVITS、Azure Fish Speech(⭐ 10k+) 地址:https://github.com/fishaudio/fish-speech 功能: 基于VITS2,高质量、多语言、语音克隆 推理快、支持批量处理、全开源 ▌10.
前段时间帮朋友整理一批有声书内容时,我重新跑了一遍现在常见的AI配音流程。最大的感受就是:现在做有声书,最耗时间的已经不是“录音”。而是:文本整理角色区分长音频生成停顿调整字幕与时间轴尤其长篇内容。 不过真正开始做长文本后,也会发现:有声书和普通短视频配音,完全不是一个难度。一、长文本配音,最容易翻车的其实是“节奏”刚开始做长内容时,我以为只要音色自然就够了。 例如:剪映AI配音魔音工坊讯飞配音配朵朵叮叮配音媒小三配音不同方案在:男声稳定性情绪推进长文本节奏多角色切换上的差异会比较明显。尤其有些旁白刚开始很惊艳,但连续听半小时后会明显疲劳。 四、多角色配音,现在开始越来越实用以前AI有声书最大的问题之一,就是:所有角色一个语气。 现在一些方案已经开始支持:多角色voice_type情绪切换对话式生成最近测试角色旁白时,我会先单独试听:男主语气女主节奏老人声线情绪段变化有些轻量方案在前期试听时会更方便。
媒小三配音是在长文本圈子里先火起来的。它的断句逻辑不是按标点硬切,而是跟着语义走,角色对话、旁白叙述能自动区分,几十万字的稿子扔进去也不卡。 叮叮配音微信小程序直接搜,完全免费,不限字数不限时长。5000字的文案30秒出稿,断句准确率在免费工具里排前列,多音字还能单独标。没有多角色能力,但单人旁白的长文本配音,它就是零成本最优解。 写稿、配音、字幕一条线跑通,AI生成的文案直接进配音环节,断句在生成阶段就对齐了,不用来回倒腾。音色按场景分好类,"悬疑男声""温柔女声"直接选,日更博主用它能把效率拉满。 ,够用,但仅限于够用说到底,剪映内置配音没变,变的是观众的耳朵。 这个趋势还在加速,下一个被淘汰的,可能不只是配音工具本身。
于是我做了一个决定:自己造一条"童话视频生产线",让AI画绘本、AI念旁白、AI配音乐,最后成品直接发到抖音账号上,攒一个属于自己孩子的"睡前故事专辑"。 一个晚上下来,这条生产线产出了16部安徒生童话视频(竖屏9:16,带配音、带原创配乐),其中7部已经自动发布到抖音。下面把整条流水线拆开讲。 二、先看全景:五个环节,一条流水线展开代码语言:TXTAI代码解释故事文本──►AI画插画──►AI配音──►AI合成配乐──►渲染成片──►自动发抖音(竖屏插画)(情感旁白)(原创悲伤钢琴曲)(1080 四、环节二:让故事"开口说话"——配音的情绪是调出来的配音用的是edge-tts(微软Edge浏览器同款免费TTS),音色选zh-CN-XiaoxiaoNeural(晓晓)。 +0.6秒呼吸留白;逐页用ffmpeg编码h264+aac分段渲染,最后concat拼接、amix把旁白和BGM混成一条音轨。
每日免费试用(可体验全部功能)音色数量:超过1300种,内含20种情绪标签(冷笑、哽咽、怒吼、撒娇等)多角色能力:自动识别剧本角色(如“小明说:”)并分配不同声线,一键生成多角色对话声音克隆:支持5-10 还原度较高技术门槛:低开发者价值:可用于验证短剧多角色项目中的角色‑声线映射方案,声音克隆结果可作为自定义音色的参考样本,降低自研克隆技术的成本三、云端API方案对比(适合规模化生产)当项目需要批量生成(月产超过10 指标方案A(国内主流)方案B(微软Azure)方案C(ElevenLabs)方案D(OpenAI)首包延迟(国内)300-400ms~120ms450ms+(需代理)400ms+(需代理)中文自然度(1-10 月无超出后单价约1.3元/千字0.10元/千字约2.1元/千字0.10元/千字国内直连✅✅❌需代理❌需代理SSML支持支持完整基础基础流式合成WebSocket✅✅✅选型参考:对延迟极度敏感(实时对话、直播旁白 python#伪代码示例frompydubimportAudioSegmentrole_voice={"小明":"zh_male_young","老师":"zh_male_deep","旁白":"zh_female_narrator
3-5分钟视频),日更用户基本够用音色:超过1000种,分类细致(悬疑男声、战神男声、电竞解说、企业宣传等)关键功能:AI写作、音频转文字(一键导出SRT字幕)、视频转文字操作方法:用确认好的音色合成旁白 (如“小明说:”)并分配不同声线;5-10秒声音克隆(阿里达摩院技术)操作方法:编写短剧剧本并标注角色,粘贴至媒小三配音,一键生成多角色对话音频,观察每个角色被分配的自然音色风格(如小明→青年男声,老师 →成熟男声,旁白→女声叙述)。 :|$)"returnre.findall(pattern,script,re.DOTALL)role_voice={"小明":1003,#活力男声"老师":1002,#成熟男声"旁白":1004#温润女声 +腾讯云TTS按量约30-100元中小规模生产>20万腾讯云TTS批量生成约120元/10万字规模化生产开发流程建议:验证阶段(0元):用叮叮配音快速测试文案,确定腾讯云TTS的VoiceType方向。
最近在做短视频自动旁白和小说推文生成时,重新整理了一遍目前常见的中文TTS(文本转语音)方案。 目前测试下来,像:叮叮配音配朵朵媒小三配音剪映AI配音这类封装型工具,在前期验证阶段会明显提高效率。尤其在处理:男声旁白多角色对话悬疑解说科普类视频时,直接试听会比反复调API参数更直观。 3.多角色场景切换在测试短剧旁白时,又遇到一个问题:角色之间缺少区分。后来会先在试听层测试不同voice_type,再进入API阶段。 五、ffmpeg拼接与字幕处理实际做自动旁白时,仅生成音频还不够。 尤其中文旁白场景里,真正影响听感的,很多时候已经不是模型本身。而是:断句停顿语速情绪强度这些细节。
直到我最近翻到一个开源小工具——jianying-editor,它能让你用Python脚本,一句话就把素材、字幕、配音、BGM全塞进剪映草稿里。 Jianying Editor 这个技能 指令 2:豆包你好,我给你素材,你给我用剪映剪辑一个既有网感又能获得高播放还能看起来剪辑技术很厉害的视频,要达到百万剪辑师的水平,开篇设计强吸引力钩子;根据素材内容精准搭配配音 按以前的做法,我得: 打开剪映,新建竖屏项目 一段一段导入7个视频 在两段视频之间加转场 给每段视频打字幕 找一首BGM拖进去 用AI配音把旁白念出来 调整音量、对齐时间轴 光想想就困了。 就像你跟剪辑师说"帮我把这7段视频拼起来,加个BGM,配个女声旁白",它替你跑腿。 它能干的事,比我演示的多 我上面只是用了最基础的功能。 发现还挺能打: 素材处理 导入视频、图片、音频,自动识别类型 支持画中画、多轨道叠加 webm自动转成剪映能认的mp4 字幕和文字 加普通字幕、花字(带渐变描边那种) 富文本高亮关键词 导入SRT字幕文件 配音
一、前言 在现在很多自媒体平台的剧情类短视频创作中,多角色配音是核心环节但痛点显著:真人配音成本高、周期长,通用 TTS 工具缺乏角色区分度,多语言 /多情绪适配性差,且难以批量处理剧本、 该系统以 SpeechT5 为核心引擎,支持中英文多角色配音,覆盖 “剧本解析→语音合成→音频拼接→字幕生成→项目报告” 全流程,还提供 Web 可视化界面与批量处理能力,完全适配自媒体小团队的配音需求 旁白: 直接文本视为旁白 # 时长估算算法:基于字符数和内容复杂度 duration = len(text) * 0.12 # 每个字符约0.12秒 if any(char 主要执行流程完整实例流程主要步骤:系统初始化:创建配音系统实例,设置输出目录角色配置:加载默认角色(小明、小红、老师、旁白等)剧本处理:解析示例剧本,识别角色对话和音效标记语音生成:为每个角色台词生成语音文件音频拼接 说话人: male_young, 语速: 1.1x, 音调: +0.5 半音 ✅ 语音已保存: my_drama_project\temp_audio\line_009_小明_215331.wav [10
我之前做一个数码评测号,每条视频的旁白都自己录。架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频光配音就要折腾两三个小时。 媒小三的声音克隆同样支持5-10秒录音生成专属声线,技术底子来自阿里达摩院。 :5-10秒录音测试,确认克隆还原度第二步(多设备测试)→叮叮配音:在不同设备对比听感,确定参数普适性第三步(样片验证)→配朵朵:制作完整样片+字幕,验证音画匹配第四步(语速验证)→布丁配音:快速确定Speed +小程序+APP每日试用5-10秒克隆预览录音质量验证+克隆预览叮叮配音小程序不限字数/时长1000种音色多设备听感基准测试配朵朵网页+小程序+APP每日3-5分钟配音+字幕一体化样片制作+字幕验证布丁配音小程序完全免费极速出稿语速 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音,5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音
在万象有声上,上传文稿后大约10分钟就能完成:智能拆章:AI自动识别章节结构,生成目录。 实测玄幻小说里出场不到3次的小配角都能抓到,准确率相当高;台词/旁白拆分:自动区分"谁说的"和"旁白描述",每句台词还标注了情绪标签(愤怒、悲伤、调侃等);生僻字/多音字标注:内置百万级网文发音字典,连修仙玄幻里的 传统3-5天的画本工作→10分钟搞定,这一步就能省掉大量时间。第二步:配音——AI/真人/混合,三种模式随你选万象有声提供了上千款AI播音声线,覆盖不同性别、年龄、风格。 三种模式灵活切换:模式适合谁优势纯AI配音批量做中长尾内容速度快、成本低纯真人配音追求精品质量情感表现力最强AI+真人混合大多数场景关键角色用真人,旁白/配角用AI第三步:智能对轨——行业独家黑科技,用过就回不去如果你做过有声书后期 实际效率对比,数字说话拿一本20万字玄幻有声书举例:环节传统方式万象有声画本3-5天10分钟配音7-14天AI配音1-2天;混合3-5天对轨3-7天30分钟-1小时后期5-7天2-3天审听2-3天半天总计