用 WorkBuddy 做 AI 漫剧做到第二部时,卡在一个老问题上:分镜、出图都顺了,但配音库里找不到合适的中文 TTS,装配成片时 Flova 那边提示没有可用的配音技能。 后来我试了另一条路:让配音在本地干,WorkBuddy 只管装配。我电脑装了 Python,用的是微软 edge-tts(免费、不限量、效果接近真人)。关键套路:1. 配音脚本化:把剧本里每句台词按【角色+镜号】整理成清单,一个脚本循环调用 edge-tts,按镜号命名输出 mp3(镜2_苏晚.mp3、镜3_顾行舟.mp3),Flova 装配时直接对位放时间轴,不用手工拼接 2. 分角色调声:edge-tts 每个中文声线音色都不同——女主用清冷女声、男主用低沉男声降音调、管家用老年声线降语速。同一句台词,"面无表情地念"才是喜剧效果,AI 同样能靠语速和音调调出来。
做完这一关,我手上的盘里有2个角色的定妆照,后面6个镜头全部基于这两张脸生。第三步:分镜画面生成按7个镜头逐个生成画面,每个镜头都上传对应角色的定妆照。大部分镜头一版就过了。 最后2秒黑屏出白字"这一去,再没人见过他们。"压迫感就出来了。实际做出来的效果没有想象中完美,但作为第一部,跑通流程比追求细节重要。第四步:配音配音用了edge-tts,完全免费,本地跑。 9段配音分轨导出,每条单独存mp3,方便后期剪辑的时候细调对齐。这里有个经验:古风短剧的旁白慢一点反而更有味道。不要赶。给观众留出看画面的时间。第五步:剪辑合成剪辑用的是剪映,免费的。 2. 旁白比角色对话好控。 角色对话要做口型同步,AI目前的口型对齐效果还是不太稳定。要么对不上,要么对了但表情僵硬。旁白不存在这个问题。我的策略是:关键台词用角色原声,其余用旁白推进。3. 配音语速要慢。 古风题材,旁白慢0.1-0.2倍,氛围感翻倍。女声也慢一点,温柔感更足。6. 先出粗剪版,再迭代。 第一版丑没关系,能跑通全流程就是胜利。我的v1版粗糙得很,但v6版就明显能看了。
市面上的 TTS 工具很多,但真正适合视频旁白和批量配音的工具,关键不只是“能不能把文字读出来”,而是能不能把后面的工作一起做好:文稿怎么拆分、音频怎么对应、句子之间怎么停顿、字幕能不能直接用、批量文件能不能一次导出 三种模式,按你的工作方式生成普通模式适合最简单的全文配音。把文章、脚本或旁白粘贴到左侧输入框,点击生成即可得到一个完整音频,不要求分页,也不会因为普通换行就强制拆成多个文件。 它适合视频旁白、影视解说、短视频脚本、播客文稿、课程配音、语言学习和批量音频素材制作。 如果你正在寻找“TXT 每行生成一个 MP3”“逐页生成配音”“句间停顿加 SRT 字幕”的 Windows 工具,欢迎试试 v1.4.0。 #EdgeTTS #语音合成 #AI配音 #视频旁白 #批量配音 #SRT字幕 #开源软件 #Windows工具 #Python项目
为了让观众欣赏其他语言的电影,历史上有这样一些主流译制手段: 1 配音 将原片台词翻译后由配音演员模拟原片的情感与状态读出,用配音音轨代替原片的台词音轨,配音的声音尽量与画面中演员的嘴唇动态吻合 观众听不到画面中演员的声音,而是配音演员的声音。 2 字幕 将原片台词翻译后加到电影画面中。观众听到的所有声音是原片的声音,但需要阅读画面中的文字来理解台词和内容。 3 旁白 旁白是把原片台词讲解出来,进行诚实的翻译。旁白声音的时间控制并不与原片的声音完全同步,只是大致同步。 这种手段像是配音与字幕的中和,虽然是用声音表现,但并不模拟原片台词的情感与状态,也完全不做「对口型」的努力。观众能听到原片的台词声音,但是旁白一开口,原片的音量就会调小,被旁白的声音盖过。
doc-to-video:将 Markdown 一键变成专业视频 让 AI Agent 自动把技术文档变成带配音旁白的 1080p 视频,零门槛,10 分钟搞定。 一句话介绍doc-to-video 是一个 OpenClaw/QClaw Agent Skill,能把任意 Markdown 技术文档自动转换成带自然人声旁白的专业视频。 传统的视频制作流程:写旁白脚本 → 人工配音 → 剪辑 → 加字幕 → 导出即使有工具,也需要手动操作,过程碎片化doc-to-video 把这个流程压缩成一条命令: 音视频帧级同步这是视频配音最常见也最难解决的问题。大多数方案靠估算帧数,导致音视频不同步。 A:macOS 可用系统语音:say -v Tingting -r 175 "旁白内容",然后 ffmpeg -i audio.aiff audio.mp3。
最近在做短视频自动旁白和小说推文生成时,重新整理了一遍目前常见的中文TTS(文本转语音)方案。 目前测试下来,像:叮叮配音配朵朵媒小三配音剪映AI配音这类封装型工具,在前期验证阶段会明显提高效率。尤其在处理:男声旁白多角色对话悬疑解说科普类视频时,直接试听会比反复调API参数更直观。 2.停顿控制问题默认生成时,很多模型会把一句话直接平着读完。后面开始尝试SSML插入停顿。例如:<speak>很多人以为,鲸鱼不会交流。 五、ffmpeg拼接与字幕处理实际做自动旁白时,仅生成音频还不够。 字幕时间轴音频拼接背景音混合音量归一化比如:ffmpeg-ivoice.mp3-ibgm.mp3\-filter_complex"[1:a]volume=0.2[a1];[0:a][a1]amix=inputs=2"
它仅需几秒钟的参考音频即可实现语音克隆、插入、删除、替换等编辑功能,同时支持零样本文本转语音,并在有声书、短视频、播客等“真实场景音频”中展现出超越 XTTS-v2、VALL‑E 等前沿模型的性能。 想配音但找不到匹配情感或口音的主播?传统 TTS 通常需要大量样本。视频素材需补充旁白/音效提示,但不想重新录制。 核心功能功能描述应用举例零样本语音编辑在已有录音中插入/删除内容,效果自然纠错录音稿、补充遗漏零样本 TTS以新口音/风格合成完全新语音视频配音、广告旁白高质量自然度人耳几乎无法分辨真实与合成语音自然度可用于正式出版音频或播客移动端 :克隆原配音风格,在无重录的情况下修改字幕内容 广告和旁白:导入参考音,仅插入特定文字即可生成新版本 AI 科研实验:开源模型让研究者可以尝试新思路对比分析项目零样本编辑零样本 TTS本地部署开源自然度 VoiceCraft✅✅✅✅⭐⭐⭐⭐⭐VALL‑E❌(仅续读)✅❌✅⭐⭐⭐☆XTTS‑v2❌✅❌❌⭐⭐⭐☆AudioLM❌❌✅✅⭐⭐来看VoiceCraft 独特优势:支持语音中局部空缺编辑与替换;零样本克隆
今天我们将给大家介绍如何使用Lighthouse轻量服务器搭建一个属于自己的在线视频配音工具,可以将文案制作为mp3文件并且生成对应的字幕视频,以便大家在制作视频的过程中方便地为自己的视频添加自然逼真的配音 ,并且为其它视频创作者提供帮助 LiuChangFreeman/ms-tts-web (github.com) github.png 一、购买一台轻量服务器 腾讯云的学生优惠是相当给力的,2核4G一年只要 ,非常方便 os.png 通过在当前系统生成ssh密钥对,我们可以将生成的公钥添加到控制台中,并绑定到轻量实例,这样就可以免密码登录了 key.png key2.png 二、构建Docker镜像 build.png 在进行前端编译的过程中会卡住一段时间,这是由于node_modules小文件太多造成的,需要等待其完成,不可中断 npm.png 最后镜像构建完毕后,我们就可以开启服务了 build2. png 三、开启服务 首先我们需要准备一个目录专门用于存放临时文件,考虑到有可能会有人使用晓晓配音生成违法的文件,因此晓晓配音的链接有效期并不长,生成的mp4和mp3文件都是定时过期的 mkdir /tts_storage
面向影视解说、短剧多角色、课件配音等场景,提供API集成代码与轻量工具验证方案,助你快速构建配音能力在开发智能语音应用、批量课程配音、短视频自动解说时,TTS(文本转语音)是一项基础能力。 1002resp=client.TextToVoice(req)withopen(f"output_{idx}.mp3","wb")asf:f.write(resp.Audio)texts=["文案1","文案2" ,为API的voice_type选型提供参考2.2配朵朵——写稿+配音+字幕一体化平台:网页+微信小程序免费额度:每日登录送免费时长(约3-5分钟视频)音色:1000+,按“悬疑解说”“史诗旁白”“电竞解说 pythonfrompydubimportAudioSegmentrole_voice={"小明":1002,#青年男声"老师":1003,#成熟男声"旁白":1004#女声叙述}defgenerate_multi_role 编写批量生成脚本利用SSML控制停顿、语速,提升旁白质量多角色项目自行解析剧本并组合多voice六、总结2026年,开发者无需在“全人工”与“全API”之间二选一。
一、前言 在现在很多自媒体平台的剧情类短视频创作中,多角色配音是核心环节但痛点显著:真人配音成本高、周期长,通用 TTS 工具缺乏角色区分度,多语言 /多情绪适配性差,且难以批量处理剧本、 该系统以 SpeechT5 为核心引擎,支持中英文多角色配音,覆盖 “剧本解析→语音合成→音频拼接→字幕生成→项目报告” 全流程,还提供 Web 可视化界面与批量处理能力,完全适配自媒体小团队的配音需求 1 秒,台词时长按 “字符数 ×0.12 秒” 估算(最短 2 秒)。 主要执行流程完整实例流程主要步骤:系统初始化:创建配音系统实例,设置输出目录角色配置:加载默认角色(小明、小红、老师、旁白等)剧本处理:解析示例剧本,识别角色对话和音效标记语音生成:为每个角色台词生成语音文件音频拼接 使用视频编辑软件导入音频和字幕 2. 添加背景图片或视频 3.
于是我做了一个决定:自己造一条"童话视频生产线",让AI画绘本、AI念旁白、AI配音乐,最后成品直接发到抖音账号上,攒一个属于自己孩子的"睡前故事专辑"。 二、先看全景:五个环节,一条流水线展开代码语言:TXTAI代码解释故事文本──►AI画插画──►AI配音──►AI合成配乐──►渲染成片──►自动发抖音(竖屏插画)(情感旁白)(原创悲伤钢琴曲)(1080 实操要点:生成尺寸选1024×1536(2:3竖版),后期裁切适配1080×1920竖屏刚好;提示词模板可以固定成一句:"儿童绘本插画风格,明亮鲜艳的卡通色彩,温柔可爱的人物造型,<场景描述>,柔和光线 四、环节二:让故事"开口说话"——配音的情绪是调出来的配音用的是edge-tts(微软Edge浏览器同款免费TTS),音色选zh-CN-XiaoxiaoNeural(晓晓)。 、底部半透明圆角面板);每页时长=该页旁白音频长度+0.6秒呼吸留白;逐页用ffmpeg编码h264+aac分段渲染,最后concat拼接、amix把旁白和BGM混成一条音轨。
最近重新整理短视频解说项目时,发现自己前期在AI配音上踩过不少坑。一开始总觉得:只要音色够像真人,视频听起来应该就不会有问题。 但真正做了一段时间后才发现,很多播放数据差的视频,并不是剧情不行,而是:旁白让人听着“很累”。尤其影视解说、悬疑旁白、小说推文这种内容,一旦AI配音节奏不对,观众前几秒就会直接划走。 后面连续调整了几十条内容后,我发现之前踩得最严重的坑,其实并不是模型,而是:“把AI配音当成真人录音去用。” 主要测试:男声风格停顿节奏情绪强度多角色语气目前比较常用的试听方案,包括:叮叮配音配朵朵媒小三配音主要目的不是正式生产。 而是提前确认:哪种voice_type更适合剧情哪种节奏更适合悬疑旁白哪种停顿更自然有时候同一篇文案,仅仅换一个音色,视频代入感都会完全不同。
直到我最近翻到一个开源小工具——jianying-editor,它能让你用Python脚本,一句话就把素材、字幕、配音、BGM全塞进剪映草稿里。 指令 1:豆包你好,帮我安装 Jianying Editor 这个技能 指令 2:豆包你好,我给你素材,你给我用剪映剪辑一个既有网感又能获得高播放还能看起来剪辑技术很厉害的视频,要达到百万剪辑师的水平, 开篇设计强吸引力钩子;根据素材内容精准搭配配音、字幕,字幕字体和样式也要好看、标题、音效、表情包贴纸、特效与滤镜,做好基础调色。 按以前的做法,我得: 打开剪映,新建竖屏项目 一段一段导入7个视频 在两段视频之间加转场 给每段视频打字幕 找一首BGM拖进去 用AI配音把旁白念出来 调整音量、对齐时间轴 光想想就困了。 inviteCode=oga1ahgc2、KREA-2-EDIT-One-image-V2 单图编辑工作流【短剧必备】 体验地址:https://www.runninghub.cn/post/2088923554007048194
前段时间帮朋友整理一批有声书内容时,我重新跑了一遍现在常见的AI配音流程。最大的感受就是:现在做有声书,最耗时间的已经不是“录音”。而是:文本整理角色区分长音频生成停顿调整字幕与时间轴尤其长篇内容。 不过真正开始做长文本后,也会发现:有声书和普通短视频配音,完全不是一个难度。一、长文本配音,最容易翻车的其实是“节奏”刚开始做长内容时,我以为只要音色自然就够了。 例如:剪映AI配音魔音工坊讯飞配音配朵朵叮叮配音媒小三配音不同方案在:男声稳定性情绪推进长文本节奏多角色切换上的差异会比较明显。尤其有些旁白刚开始很惊艳,但连续听半小时后会明显疲劳。 四、多角色配音,现在开始越来越实用以前AI有声书最大的问题之一,就是:所有角色一个语气。 现在一些方案已经开始支持:多角色voice_type情绪切换对话式生成最近测试角色旁白时,我会先单独试听:男主语气女主节奏老人声线情绪段变化有些轻量方案在前期试听时会更方便。
媒小三配音是在长文本圈子里先火起来的。它的断句逻辑不是按标点硬切,而是跟着语义走,角色对话、旁白叙述能自动区分,几十万字的稿子扔进去也不卡。 叮叮配音微信小程序直接搜,完全免费,不限字数不限时长。5000字的文案30秒出稿,断句准确率在免费工具里排前列,多音字还能单独标。没有多角色能力,但单人旁白的长文本配音,它就是零成本最优解。 写稿、配音、字幕一条线跑通,AI生成的文案直接进配音环节,断句在生成阶段就对齐了,不用来回倒腾。音色按场景分好类,"悬疑男声""温柔女声"直接选,日更博主用它能把效率拉满。 ,够用,但仅限于够用说到底,剪映内置配音没变,变的是观众的耳朵。 这个趋势还在加速,下一个被淘汰的,可能不只是配音工具本身。
千套音色素材库的价值,就是为上百个虚拟角色提供足够丰富的声线备选,覆盖少年、青年男女、中老年、萝莉、御姐、旁白、反派等不同声线风格。 -**旁白叙事专用素材**语速平稳,吐字清晰,适合故事开篇、剧情过渡旁白,不适合角色对话。 /voice_lib/male_evil_011.wav","旁白":". 2.GPU显存溢出OOM解决:分步加载模型,推理完成就卸载释放显存;TTS切换CPU推理;全部模型优先使用量化版本。 2.禁止把本素材用于诈骗、恶搞、伪造语音等违法场景。3.如果产出的漫剧用于商业发布,需要确认素材授权范围,部分开源TTS模型有商业许可约束。
本次实操选用工具(全部免费在线工具,无需本地安装):文本大模型:用于口播文案、脚本大纲原创撰写AI 图像生成工具:生成技术讲解配套演示配图AI 智能配音工具:生成自然人声旁白,适配技术口播语调在线一站式剪辑平台 :自动匹配画面、字幕、背景音乐,完成后期合成前期素材准备:确定本次讲解主题「AI 工作流效率技巧」,提前梳理 3 个核心知识点、2 个实操案例,预留成品视频时长 45 秒左右,符合短视频流量推荐时长。 步骤 2:配套演示图片批量生成(AI 绘图环节)将脚本内的技术关键词拆分,逐一输入绘图工具,生成流程示意图、工具界面演示图、操作步骤示意图。统一设置图片风格、分辨率、色调,保证整套配图视觉统一。 步骤 3:AI 人声配音生成(配音环节)导入修改完成的最终文案,选择沉稳技术向音色,调整语速至每分钟 200 字,开启停顿智能识别、语气轻重调节功能,生成完整旁白音频,导出无杂音音频文件。 五、最终成品效果展示经过完整流程操作与优化调整,最终导出高清技术口播视频:人声旁白自然流畅,无生硬机械感;配图清晰统一,画面切换节奏舒适;字幕精准无错漏,背景音乐不盖过人声,整体干货密度高、节奏紧凑,完全满足技术账号发布标准
3-5分钟视频),日更用户基本够用音色:超过1000种,分类细致(悬疑男声、战神男声、电竞解说、企业宣传等)关键功能:AI写作、音频转文字(一键导出SRT字幕)、视频转文字操作方法:用确认好的音色合成旁白 →成熟男声,旁白→女声叙述)。 client.TextToVoice(req)withopen(f"output_{idx}.mp3","wb")asf:f.write(resp.Audio)texts=["文案段落1","文案段落2" :|$)"returnre.findall(pattern,script,re.DOTALL)role_voice={"小明":1003,#活力男声"老师":1002,#成熟男声"旁白":1004#温润女声 七、总结2026年,通过“轻量工具免费定参+腾讯云TTS按量生产”的组合,开发者可以大幅提升配音能力集成效率。丁叮配音负责音色筛选,配朵朵完成样片与字幕,媒小三配音验证多角色映射——全部0成本。
实测玄幻小说里出场不到3次的小配角都能抓到,准确率相当高;台词/旁白拆分:自动区分"谁说的"和"旁白描述",每句台词还标注了情绪标签(愤怒、悲伤、调侃等);生僻字/多音字标注:内置百万级网文发音字典,连修仙玄幻里的 第二步:配音——AI/真人/混合,三种模式随你选万象有声提供了上千款AI播音声线,覆盖不同性别、年龄、风格。重点是——情绪表达:画本阶段标注的情绪标签,配音时会自动体现。 当然,如果你想用真人配音或者真人+AI混合,也完全支持。 三种模式灵活切换:模式适合谁优势纯AI配音批量做中长尾内容速度快、成本低纯真人配音追求精品质量情感表现力最强AI+真人混合大多数场景关键角色用真人,旁白/配角用AI第三步:智能对轨——行业独家黑科技,用过就回不去如果你做过有声书后期 实际效率对比,数字说话拿一本20万字玄幻有声书举例:环节传统方式万象有声画本3-5天10分钟配音7-14天AI配音1-2天;混合3-5天对轨3-7天30分钟-1小时后期5-7天2-3天审听2-3天半天总计
但在短视频旁白、产品介绍、剧情解说等场景中,用户对语音节奏和真人感非常敏感。 目前TimelineStudio内置了两位中文女声:晴岚:声音相对温暖、自然,适合产品介绍和叙事旁白;若溪:声音更清晰、轻快,适合教程、资讯和短视频解说。 这个间隔既能避免句子粘连,也不会让旁白显得过于松散。分句不能只识别句号简单按照句号拆分并不够。 在TimelineStudio中,接受后的配音会成为时间线的音频骨架。画面、转场、字幕和动画都围绕最终语音节奏进行调整,而不是让语音去服从预先设定的模板时长。对于视频旁白来说,这种流程通常更自然。 声音克隆与基础配音的边界TimelineStudio已经提供OpenVoiceV2,用于获得授权后的声音转换。因此,我们没有让HojoTTS同时承担完整的用户声音管理逻辑。