首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏bunny的专栏

    【玩转Lighthouse】轻松搭建视频配音工具晓晓配音

    今天我们将给大家介绍如何使用Lighthouse轻量服务器搭建一个属于自己的在线视频配音工具,可以将文案制作为mp3文件并且生成对应的字幕视频,以便大家在制作视频的过程中方便地为自己的视频添加自然逼真的配音 ,并且为其它视频创作者提供帮助 LiuChangFreeman/ms-tts-web (github.com) github.png 一、购买一台轻量服务器 腾讯云的学生优惠是相当给力的,2核4G一年只要 推荐同学们买一台作为学习使用,用来部署晓晓配音完全绰绰有余 image.png 购买完成后我们可以在控制台重置其系统为Ubunut+Docker专版,由于此系统自带了Docker环境,我们上手就能立刻开始部署 我们需要在防火墙放行对应的端口,推荐一次性开一个范围的端口,这样我们在部署服务的时候就可以不用每次都到控制台编辑规则了 20220414190405.png 登录我们的轻量服务器,然后在任意目录克隆晓晓配音的源代码 然后使用docker logs查看容器服务是否正常开启 docker logs ms_tts 当看到服务顺利监听到8019端口后,部署就完成了 run.png 最后我们就可以通过ip端口的方式访问晓晓配音服务了

    2K100编辑于 2022-04-14
  • 来自专栏云瓣

    基于RN开发的一款视频配音APP(开源)

    一些功能模块: 启动界面轮播效果的实现; 通过短信验证码登入; 视频的上传以及静音处理; 音频的上传; 视频和音频的整合; 用户资料的更新; 评论模块 点赞模块

    1.2K80发布于 2018-05-02
  • 2026年腾讯云TTS声音克隆实战:6秒录音克隆自己的声音,API批量生产全记录

    架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说"每次声音都不一样,记不住你"。 媒小三的声音克隆同样支持5-10秒录音生成专属声线,技术底子来自阿里达摩院。 (录音验证)→媒小三配音5-10秒录音测试,确认克隆还原度第二步(多设备测试)→叮叮配音:在不同设备对比听感,确定参数普适性第三步(样片验证)→配朵朵:制作完整样片+字幕,验证音画匹配第四步(语速验证 声音克隆限时免费声音克隆+批量合成规模化生产媒小三配音网页+小程序+APP每日试用5-10秒克隆预览录音质量验证+克隆预览叮叮配音小程序不限字数/时长1000种音色多设备听感基准测试配朵朵网页+小程序+ 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    42710编辑于 2026-06-22
  • 如何配音更有辨识度?2026年腾讯云TTS声音克隆+4款免费工具协同全记录

    架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说"每次声音都不一样,记不住你"。 媒小三的声音克隆同样支持5-10秒录音生成专属声线,技术底子来自阿里达摩院。 (录音验证)→媒小三配音5-10秒录音测试,确认克隆还原度第二步(多设备测试)→叮叮配音:在不同设备对比听感,确定参数普适性第三步(样片验证)→配朵朵:制作完整样片+字幕,验证音画匹配第四步(语速验证 声音克隆限时免费声音克隆+批量合成规模化生产媒小三配音网页+小程序+APP每日试用5-10秒克隆预览录音质量验证+克隆预览叮叮配音小程序不限字数/时长1000种音色多设备听感基准测试配朵朵网页+小程序+ 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    37710编辑于 2026-06-22
  • 2026年腾讯云TTS声音克隆实战:从5秒录音到批量生产,开发周期压缩80%

    架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说“每次声音都不一样,记不住你”。 媒小三的声音克隆同样支持5-10秒录音生成专属声线,技术底子来自阿里达摩院。 :5-10秒录音测试,确认克隆还原度第二步(多设备测试)→叮叮配音:在不同设备对比听感,确定参数普适性第三步(样片验证)→配朵朵:制作完整样片+字幕,验证音画匹配第四步(语速验证)→布丁配音:快速确定Speed +小程序+APP每日试用5-10秒克隆预览录音质量验证+克隆预览叮叮配音小程序不限字数/时长1000种音色多设备听感基准测试配朵朵网页+小程序+APP每日3-5分钟配音+字幕一体化样片制作+字幕验证布丁配音小程序完全免费 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    42910编辑于 2026-06-22
  • 2026年配音工具避坑指南:腾讯云TTS声音克隆+4款免费工具,个人IP批量生产

    架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说“每次声音都不一样,记不住你”。 媒小三的声音克隆同样支持5-10秒录音生成专属声线,技术底子来自阿里达摩院。 (录音验证)→媒小三配音5-10秒录音测试,确认克隆还原度第二步(多设备测试)→叮叮配音:在不同设备对比听感,确定参数普适性第三步(样片验证)→配朵朵:制作完整样片+字幕,验证音画匹配第四步(语速验证 声音克隆限时免费声音克隆+批量合成规模化生产媒小三配音网页+小程序+APP每日试用5-10秒克隆预览录音质量验证+克隆预览叮叮配音小程序不限字数/时长1000种音色多设备听感基准测试配朵朵网页+小程序+ 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    63610编辑于 2026-06-22
  • 2026年TTS工具技术调研:六款文字转语音服务的功能参数对比

    一、配朵朵平台形态:网页端、小程序(账号互通)登录要求:支持扫码登录或小程序授权登录免费政策:每日登录赠送免费时长(约3-5分钟视频)声音克隆:不支持捏声音(自定义音色):不支持API接口:未提供公开API 附加功能:AI写作、视频转文字、音频转文字、格式转换输出格式:MP3(可导出SRT字幕)技术限制:单次生成文本长度有上限;免费额度每日重置不累积;功能模块较多,首次使用需熟悉界面布局二、叮叮配音平台形态 :网页端、App、小程序登录要求:手机号或第三方授权登录免费政策:每日提供免费试用次数,每月重置;正式版为会员全包模式声音克隆:支持,训练样本时长5-10秒,训练时间约3-10秒捏声音(自定义音色):支持 ,输入关键词生成自定义音色(如“温柔女声”“沉稳大叔”)API接口:未提供公开API附加功能:AI写作、文案提取、爆文标题生成、短视频脚本模板输出格式:MP3技术限制:声音克隆效果受录音环境影响,需要安静无回声环境 /音频转文字、格式转换MP3+SRT叮叮配音小程序永久免费❌❌无AI写作、视频转文字MP3布丁配音小程序完全免费❌❌无无MP3媒小三配音网页、App、小程序每日试用(月重置)✅(5-10秒)✅(关键词)

    48010编辑于 2026-06-03
  • 来自专栏星哥的AI自留地

    5分钟搞定视频翻译配音!开源极简工具KrillinAI

    5分钟搞定视频翻译配音! AI视频翻译配音工具,100种语言双向翻译,一键部署全流程,可以生抖音,小红书,哔哩哔哩,视频号,TikTok,Youtube等形态的内容成适配。 不用复杂的技术配置,不用懂高深的AI原理,甚至不需要你有专业的视频剪辑基础,它能一站式完成「视频原声音频提取→AI翻译→目标语言配音→音频与视频合成」全流程,支持上百种语言的翻译与配音,覆盖主流语种(中英日韩法德等 ,配音自然流畅,无机械感配音生硬,语调呆板,缺乏情感适配格式兼容支持MP4、MOV、AVI等主流视频格式,导出多规格格式限制多,仅支持少数视频格式免费属性开源免费,基础功能无付费门槛基础功能免费,高级功能高额收费简单说 我以「中文视频翻译成英文并配音」为例,给大家一步步演示,全程5分钟就能搞定,跟着做就行。

    27910编辑于 2026-06-26
  • 2026年配音软件红黑榜:这4款免费工具,谁是真香谁是噱头?

    我做视频剪辑这行有三年多了,从最开始的自己录音、买麦克风、做隔音,到后来用各种配音软件,踩过的坑比我做过的视频还多。 以前我做个视频,流程是这样的:备忘录写脚本→开配音软件选音色生成→导入剪辑软件加字幕→发现字幕对不上又要手动调→导出时格式不对再找转换工具。一顿操作下来,一个5分钟的视频配音环节就要折腾一个多小时。 2.媒小三配音(网页+小程序+APP)——声音克隆黑马推荐指数:⭐⭐⭐⭐⭐9.5/10一句话总结:5-10秒录音克隆你的声音,跟阿里达摩院合作的技术,不是噱头。 核心优势:声音克隆训练极快,5-10秒录音即可,不用像某些软件那样录十几分钟音色超1300种,还带20种情绪标签:冷笑、哽咽、怒吼、撒娇,做短剧和有声小说的福音多角色自动分配剧本,粘贴对话文本,它能自动识别不同人物分别配音 有次我在外面探店,剪视频的时候发现少了一段旁白,没带电脑,手机里也没装什么配音软件。随手搜到布丁配音这个小程序,打开、粘贴文案、选声音、生成,加起来不到30秒就拿到音频了。

    52610编辑于 2026-06-18
  • 配音工具技术选型:从轻量小程序到高保真TTS API的最佳实践

    ①配朵朵:一站式内容生产辅助工具,集成效率最高的入门选择平台:网页+微信小程序核心功能:集成配音、AI写作、视频转文字、音频转文字、格式转换五大模块,从写稿到出片可在同一工具中完成。 如果你需要将配音能力嵌入自动化工作流,那么配朵朵只能作为前端人工操作入口,后台需要对接第三方TTSAPI。免费额度:基础配音每日免费,AI写作和视频转文字也有免费额度,无弹窗强制收费。 我个人的实测感受:有次出差,笔记本电脑上没有任何配音软件,突然要补一条教程演示视频,打开叮叮配音小程序,十几秒就拿到了音频。 ③媒小三配音:声音克隆与多重内容创作集成平台平台:网页+App+小程序核心功能:声音克隆:5-10秒录音即可高还原复刻专属声音模型,打造个人IP辨识度。 一个音色约150元/年;新用户有免费试用开源免费(自部署),云端API约0.003元/千字符数据隐私云服务调用,需传输文本云服务,WebSocket流式支持本地部署,数据不出私有环境声音克隆训练数据要求较高5-

    66010编辑于 2026-04-28
  • 来自专栏三太子敖丙

    谷歌Gemini被曝视频造假!多模态视频是剪辑配音,击败GPT-4靠「作弊」?

    谷歌的宣传视频,竟然作假了? 在谷歌昨天发布的Gemini的宣传视频中,所有人都被那一段6分钟一镜到底的互动视频惊艳到了。 一天之内有720万的播放量。 毕竟,产品不能永远停留在宣传视频里,最终都要交到用户手上去体验。 这个视频最大的误导性在于,似乎让用户误以为Gemini能实时的读取视频信息,并且能够通过自己的理解直接推测用户的问题并直接回复。 其实本来,Gemini确实输出了视频中显示的回应。 但视频的剪辑效果,却会让用户对于Gemini的交互速度、准确性和基本模式产生误解。 视频中也没有明说,视频中的模型,到底是Gemini的哪个版本。 总的来说,这段视频半真半假,尽管包含一些真实的成分,但它根本没有反映现实。 还有人也模仿谷歌的行为,让ChatGPT从MP4中提取视频帧,然后解释视频...... ChatGPT自主从从视频中提取帧,然后网友上传6张对应图片,让ChatGPT给出具体的解释。

    66410编辑于 2023-12-12
  • 做短视频解说时,我踩过最严重的AI配音

    最近重新整理短视频解说项目时,发现自己前期在AI配音上踩过不少坑。一开始总觉得:只要音色够像真人,视频听起来应该就不会有问题。 但真正做了一段时间后才发现,很多播放数据差的视频,并不是剧情不行,而是:旁白让人听着“很累”。尤其影视解说、悬疑旁白、小说推文这种内容,一旦AI配音节奏不对,观众前几秒就会直接划走。 后面连续调整了几十条内容后,我发现之前踩得最严重的坑,其实并不是模型,而是:“把AI配音当成真人录音去用。” 一开始为了省事,我会统一设置:speed=1.1整条视频全程一个速度。结果听久后,会明显感觉:特别机械。 主要测试:男声风格停顿节奏情绪强度多角色语气目前比较常用的试听方案,包括:叮叮配音配朵朵媒小三配音主要目的不是正式生产。

    28800编辑于 2026-05-10
  • 短剧视频翻译配音为什么总有翻译腔?对话级NMT实战方案

    所以短剧视频翻译不能只看 BLEU 或逐句准确率。真正影响成片观感的是:台词能不能接得上、角色有没有同一套语言风格、配音演员读出来是否自然。对话级 NMT 怎么改造视频翻译 pipeline? 口语化 post-editing:让翻译结果适合配音而不是只适合阅读视频翻译最终要进入 AI 配音或人工配音,文本不能只追求字面对齐,还要考虑可读性和节奏。 如果团队使用 VividDub 这类一站式 AI 视频翻译方案,重点不是只看“能不能翻译”,而是看它能不能把 AI 视频翻译、AI 配音、多角色识别、字幕生成和字幕压制串成稳定链路。 配音是否读得顺:翻译文本要适合 TTS 或声音克隆,不要保留太多书面长句。字幕是否跟时间轴匹配:译文长度要能放进原视频节奏,否则后续配音和字幕都会返工。 结论:短剧翻译要从“逐句准确”走向“对话可演”通用 NMT 适合解决大多数文本翻译问题,但短剧配音是更复杂的视频本地化任务。

    25510编辑于 2026-05-27
  • 2026年配音软件集成实战:4款免费工具+云API混合架构,成本降70%

    本文从开发者视角,实测4款免费配音工具——配朵朵、叮叮配音、媒小三配音、布丁配音,并给出与腾讯云TTS等云服务的混合架构设计。一、痛点:为什么你的TTS账单总超预算? 假设你要为1万条文案生成配音(如自动化视频生成、智能客服语音)。 3.媒小三配音:声音克隆+多角色验证核心价值:5-10秒克隆个人声线,提供克隆API,行业低价。 实测流程:在安静环境录制5-10秒本人语音样本上传到媒小三,几秒后生成AI声线使用其预置音色或克隆声线,为多角色对话分配不同声音免费试用满意后,调用其克隆API集成到项目中关键能力:支持SSML、流式合成 配朵朵、叮叮配音、媒小三配音、布丁配音作为前置验证层,完全免费且功能互补,值得集成到开发工作流中。欢迎在评论区交流你的TTS集成经验或成本优化方案。

    25310编辑于 2026-06-16
  • 技术博主配音工具选型:从腾讯云TTS到开源方案,2026年5款工具横评

    在制作技术教程、开源项目演示或产品介绍视频时,配音是不可或缺的环节。个人录音耗时且效果不稳定,而AI语音合成(TTS)技术已相当成熟。 核心能力:集成配音、AI写作、视频转文字、音频转文字、格式转换五大模块,从写稿到出片可在同一工具中完成。音色库超过1000种,覆盖专业旁白、方言、童声、情感主播等,适配多类型技术内容。 基础配音每日免费,AI写作和视频转文字有免费额度,无弹窗强制收费。跨平台数据同步(网页+小程序),操作流程:粘贴文案→选音色→生成下载。技术限制:无公开API,不适合程序化批量调用。 核心能力:声音克隆基于阿里达摩院音频克隆技术,5-10秒本人录音即可生成高还原度专属声线。“捏声音”功能:自定义声线参数(性别、年龄、音调、气质)。 0元轻量个人使用新手、应急媒小三配音无否高精度(5-10秒)每日免费会员制声音克隆与IP个人IP、品牌声线开发者选型建议需要企业级多语言TTS、与腾讯云生态集成:腾讯云TTS提供多语种支持(40+语种)

    2.1K20编辑于 2026-04-21
  • 2026年配音工具技术选型:从轻量人工到腾讯云TTS的全栈方案

    在开发视频自动配音、短剧角色生成、智能语音交互等应用时,TTS(文本转语音)是核心依赖之一。对于开发者,常常面临一个抉择:轻量人工工具操作便捷但无法自动化;云API功能强大但前期验证成本高。 )音色数量:1000+,按“悬疑解说”“电影预告”“史诗旁白”“电竞解说”分类附加功能:AI写作、音频转文字(SRT)、视频转文字、格式转换生成速度:约1分钟/次多角色能力:手动切换不同音色开发者/创作者价值 :音频转文字功能可快速生成带时间轴的SRT字幕,用于制作双语视频或辅助测试集标注音色分类清晰,便于快速定位合适的声音风格每日免费额度足够个人日更使用1.3媒小三配音——短剧多角色与声音克隆验证器平台:网页 +App+小程序免费额度:每日免费试用(可体验全部功能)音色数量:1300+种,含20种情绪标签(冷笑、哽咽、怒吼等)多角色能力:自动识别剧中角色并分配不同声线声音克隆:支持(5-10秒录音克隆,阿里达摩院技术 三、分层组合建议项目阶段推荐方案成本适用场景需求验证叮叮配音+配朵朵0元快速测试音色、文案、字幕效果短剧/多角色验证媒小三配音(免费试用)0元确定角色声线映射小批量人工制作配朵朵(每日免费)0元日更视频

    55610编辑于 2026-05-06
  • TTS服务技术选型:8款文字转语音工具的免费额度与API能力对比

    一、无API型(仅手动界面操作)1.布丁配音API/SDK:无免费额度:无限字数、无限时长音色:约几百种(普通话)平台:仅小程序2.叮叮配音API/SDK:无免费额度:无限字数、无限时长音色:约1000 种(普通话)附加功能:AI写作、视频转文字平台:仅小程序3.配朵朵API/SDK:无免费额度:每日赠送字数/时长(未公开上限)音色:约1000款(含多语种/方言)附加能力:AI写作、视频转文字、音频转文字 、格式转换、批量导入平台:网页端、App、小程序(数据互通)4.媒小三配音API/SDK:无免费额度:每日试用次数,每月重置音色能力:预置数百款+声音克隆(5-10秒录音,训练约3-10秒)+捏声音(关键词生成 wb')asfile:file.write(response['AudioStream'].read())技术参数汇总表(开发者视角)工具APISDKSSML自定义词典声音克隆免费额度(月)绑卡要求布丁配音无无否否否无限字数否叮叮配音无无否否否无限字数否配朵朵无无否否否每日赠额否媒小三配音无无否否是 (5-10秒)每月试用次数否ElevenLabsREST无官方参数化否是(≥10分钟)1万字符否(免费版)AzureTTSREST有(多语言)完整是否50万字符是GoogleTTSREST有标准否否100

    1K10编辑于 2026-05-25
  • 来自专栏Java项目实战

    阿里5.2kStar给Sora配音的EMO音视频项目开源了

    这是一个音频驱动的AI肖像视频生成系统,能够通过输入单一的参考图像和语音音频,生成具有表现力的面部表情和各种头部姿势的视频。 EMO生成的视频不仅内容丰富,而且具有极高的表现力。它能够精准捕捉并再现人类面部表情的细微变化,包括那些难以察觉的微表情。同时,视频中的头部运动与音频节奏完美匹配,增强了视频的整体观赏性和真实感。 借助先进的FrameEncoding模块,EMO能够在视频生成过程中始终保持角色身份的一致性。这意味着无论视频内容如何变化,角色的外观始终与输入的参考图像保持一致,增强了视频的连贯性和真实感。 为了提高视频生成的稳定性,EMO采用了多种控制机制,包括速度控制器和面部区域控制器等。这些机制有效避免了视频崩溃等问题,确保了视频生成的顺利进行。 生成视频 在推理阶段,EMO运用DDIM采样算法,通过迭代去噪过程,生成与输入音频同步的肖像视频片段。

    82410编辑于 2024-03-07
  • 来自专栏量子位

    这个AI能自动给视频配音,真假难辨(不服来试)

    视频内容 你将看到两段画面相同的视频,请判断哪段来自视频原声,哪段是AI根据视频画面配上的假声? 莫非两个都是真的?不可能,答案文末揭晓。 (还有更多真假难辨的视频原声和配音大对比) 真假难辨,简直让人怀疑耳朵。模型合成的假音效,什么时候都这么逼真了?一切还得从这个自动为自然环境下的视频配音的项目说起。 ? 视听关联 看闪电,知雷声。 每个类别中包含1500-3000个随机抽取的视频。 ? △ 其中4个类别的视频帧及相应波形。 值得注意的是,m通常远远小于n,因为音频的采样率远高于视频的采样率,因此音频波形序列比同步视频视频帧序列长得多。 大体来说,这个模型由两部分构成,即声音生成器和视频编码器。 每个场景的配音均为一真一假,当场揭晓答案,猜猜你能对几个——

    3.2K50发布于 2018-04-02
  • 视频配音翻译多角色识别Speaker Diarization 工程实践与踩坑记录

    重点不是介绍一个工具,而是解释为什么 diarization 在视频配音翻译里经常出错,以及怎么把错误压到后续配音流程能接受的范围内。为什么短剧里的 diarization 更容易翻车? 一条可落地的多角色识别 pipeline在视频翻译配音里,speaker diarization 通常不应该直接吃原始视频音轨。 接入视频翻译 pipeline 时要注意什么?在视频翻译配音里,diarization 的输出不是给人看的终点,而是给下游模块使用的结构化输入。 在实际项目中,我们把这套 diarization 方案集成到一条视频翻译 pipeline 里时,最大的收益不是“自动识别出几个 speaker”,而是让后续 AI 配音和声音克隆有了更稳定的角色轨道。 VividDub 这类视频本地化工作流,正是把 AI 视频翻译、AI 配音、字幕生成、硬字幕擦除和多语种输出放在同一条链路里处理,适合持续做短剧、课程、营销视频和内容库本地化。

    29500编辑于 2026-05-27
领券