首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏bunny的专栏

    【玩转Lighthouse】轻松搭建视频配音工具晓晓配音

    今天我们将给大家介绍如何使用Lighthouse轻量服务器搭建一个属于自己的在线视频配音工具,可以将文案制作为mp3文件并且生成对应的字幕视频,以便大家在制作视频的过程中方便地为自己的视频添加自然逼真的配音 ,并且为其它视频创作者提供帮助 LiuChangFreeman/ms-tts-web (github.com) github.png 一、购买一台轻量服务器 腾讯云的学生优惠是相当给力的,2核4G一年只要 推荐同学们买一台作为学习使用,用来部署晓晓配音完全绰绰有余 image.png 购买完成后我们可以在控制台重置其系统为Ubunut+Docker专版,由于此系统自带了Docker环境,我们上手就能立刻开始部署 我们需要在防火墙放行对应的端口,推荐一次性开一个范围的端口,这样我们在部署服务的时候就可以不用每次都到控制台编辑规则了 20220414190405.png 登录我们的轻量服务器,然后在任意目录克隆晓晓配音的源代码 然后使用docker logs查看容器服务是否正常开启 docker logs ms_tts 当看到服务顺利监听到8019端口后,部署就完成了 run.png 最后我们就可以通过ip端口的方式访问晓晓配音服务了

    2K100编辑于 2022-04-14
  • 来自专栏云瓣

    基于RN开发的一款视频配音APP(开源)

    一些功能模块: 启动界面轮播效果的实现; 通过短信验证码登入; 视频的上传以及静音处理; 音频的上传; 视频和音频的整合; 用户资料的更新; 评论模块 点赞模块

    1.2K80发布于 2018-05-02
  • 来自专栏云服务业务

    视频出海:腾讯云国际站AI译制与数字人直播实操方案全攻略

    单纯依靠真人拍摄、人工翻译配音的模式,已经无法跟上海外平台高频更新算法要求;依托大模型自动化内容生产,大幅压缩人力、模特、译制成本,成为所有出海短视频团队的核心刚需。 3-5 天,多语种批量产出成本极高,很难支撑日更数十条内容的运营节奏。 双模式口型同步引擎:支持柔和口型适配亚洲受众、夸张口型适配欧美短视频,单人 / 多人视频素材均可自动对齐配音唇形,大幅提升海外用户视频停留时长与商品转化;3. 调用 AI 译制接口:自动拆条识别视频核心卖点,生成适配短视频平台的竖屏片段;3. 全链路 AI 处理:语音转文字翻译、AI 多音色配音、口型对齐、字幕压制;4. 传统人工模式 VS 腾讯云 AI + 数字人方案对比表表格:对比维度传统人工内容生产模式腾讯云国际 AI 译制 + 数字人方案(2026 商用版)单条短视频制作周期3-5 天 / 条10-30 分钟 /

    32320编辑于 2026-07-17
  • 来自专栏Hank’s Blog

    3-5 处理缺失值

    > x <- c(1,NA,2,NA,3) > is.na(x) [1] FALSE TRUE FALSE TRUE FALSE > x[!is.na(x)] #找出不是缺失值 [1] 1 2 3 > x <- c(1,NA,2,NA,3) > y <- c("a","b",NA,"c",NA) > z <- complete.cases(x,y) #都不是缺失值的元素 > x[z] [1] 1 > y[z] [1] "a" > library(datasets) #import dat

    55010发布于 2020-09-16
  • 来自专栏星哥的AI自留地

    5分钟搞定视频翻译配音!开源极简工具KrillinAI

    5分钟搞定视频翻译配音! AI视频翻译配音工具,100种语言双向翻译,一键部署全流程,可以生抖音,小红书,哔哩哔哩,视频号,TikTok,Youtube等形态的内容成适配。 不用复杂的技术配置,不用懂高深的AI原理,甚至不需要你有专业的视频剪辑基础,它能一站式完成「视频原声音频提取→AI翻译→目标语言配音→音频与视频合成」全流程,支持上百种语言的翻译与配音,覆盖主流语种(中英日韩法德等 ,配音自然流畅,无机械感配音生硬,语调呆板,缺乏情感适配格式兼容支持MP4、MOV、AVI等主流视频格式,导出多规格格式限制多,仅支持少数视频格式免费属性开源免费,基础功能无付费门槛基础功能免费,高级功能高额收费简单说 我以「中文视频翻译成英文并配音」为例,给大家一步步演示,全程5分钟就能搞定,跟着做就行。

    27910编辑于 2026-06-26
  • 来自专栏三太子敖丙

    谷歌Gemini被曝视频造假!多模态视频是剪辑配音,击败GPT-4靠「作弊」?

    谷歌的宣传视频,竟然作假了? 在谷歌昨天发布的Gemini的宣传视频中,所有人都被那一段6分钟一镜到底的互动视频惊艳到了。 一天之内有720万的播放量。 毕竟,产品不能永远停留在宣传视频里,最终都要交到用户手上去体验。 这个视频最大的误导性在于,似乎让用户误以为Gemini能实时的读取视频信息,并且能够通过自己的理解直接推测用户的问题并直接回复。 其实本来,Gemini确实输出了视频中显示的回应。 但视频的剪辑效果,却会让用户对于Gemini的交互速度、准确性和基本模式产生误解。 视频中也没有明说,视频中的模型,到底是Gemini的哪个版本。 总的来说,这段视频半真半假,尽管包含一些真实的成分,但它根本没有反映现实。 还有人也模仿谷歌的行为,让ChatGPT从MP4中提取视频帧,然后解释视频...... ChatGPT自主从从视频中提取帧,然后网友上传6张对应图片,让ChatGPT给出具体的解释。

    66410编辑于 2023-12-12
  • 做短视频解说时,我踩过最严重的AI配音

    最近重新整理短视频解说项目时,发现自己前期在AI配音上踩过不少坑。一开始总觉得:只要音色够像真人,视频听起来应该就不会有问题。 但真正做了一段时间后才发现,很多播放数据差的视频,并不是剧情不行,而是:旁白让人听着“很累”。尤其影视解说、悬疑旁白、小说推文这种内容,一旦AI配音节奏不对,观众前几秒就会直接划走。 后面连续调整了几十条内容后,我发现之前踩得最严重的坑,其实并不是模型,而是:“把AI配音当成真人录音去用。” 一开始为了省事,我会统一设置:speed=1.1整条视频全程一个速度。结果听久后,会明显感觉:特别机械。 主要测试:男声风格停顿节奏情绪强度多角色语气目前比较常用的试听方案,包括:叮叮配音配朵朵媒小三配音主要目的不是正式生产。

    28800编辑于 2026-05-10
  • 短剧视频翻译配音为什么总有翻译腔?对话级NMT实战方案

    所以短剧视频翻译不能只看 BLEU 或逐句准确率。真正影响成片观感的是:台词能不能接得上、角色有没有同一套语言风格、配音演员读出来是否自然。对话级 NMT 怎么改造视频翻译 pipeline? 口语化 post-editing:让翻译结果适合配音而不是只适合阅读视频翻译最终要进入 AI 配音或人工配音,文本不能只追求字面对齐,还要考虑可读性和节奏。 如果团队使用 VividDub 这类一站式 AI 视频翻译方案,重点不是只看“能不能翻译”,而是看它能不能把 AI 视频翻译、AI 配音、多角色识别、字幕生成和字幕压制串成稳定链路。 配音是否读得顺:翻译文本要适合 TTS 或声音克隆,不要保留太多书面长句。字幕是否跟时间轴匹配:译文长度要能放进原视频节奏,否则后续配音和字幕都会返工。 结论:短剧翻译要从“逐句准确”走向“对话可演”通用 NMT 适合解决大多数文本翻译问题,但短剧配音是更复杂的视频本地化任务。

    25510编辑于 2026-05-27
  • 来自专栏量子位

    这个AI能自动给视频配音,真假难辨(不服来试)

    视频内容 你将看到两段画面相同的视频,请判断哪段来自视频原声,哪段是AI根据视频画面配上的假声? 莫非两个都是真的?不可能,答案文末揭晓。 (还有更多真假难辨的视频原声和配音大对比) 真假难辨,简直让人怀疑耳朵。模型合成的假音效,什么时候都这么逼真了?一切还得从这个自动为自然环境下的视频配音的项目说起。 ? 视听关联 看闪电,知雷声。 每个类别中包含1500-3000个随机抽取的视频。 ? △ 其中4个类别的视频帧及相应波形。 值得注意的是,m通常远远小于n,因为音频的采样率远高于视频的采样率,因此音频波形序列比同步视频视频帧序列长得多。 大体来说,这个模型由两部分构成,即声音生成器和视频编码器。 每个场景的配音均为一真一假,当场揭晓答案,猜猜你能对几个——

    3.2K50发布于 2018-04-02
  • 来自专栏Java项目实战

    阿里5.2kStar给Sora配音的EMO音视频项目开源了

    这是一个音频驱动的AI肖像视频生成系统,能够通过输入单一的参考图像和语音音频,生成具有表现力的面部表情和各种头部姿势的视频。 EMO生成的视频不仅内容丰富,而且具有极高的表现力。它能够精准捕捉并再现人类面部表情的细微变化,包括那些难以察觉的微表情。同时,视频中的头部运动与音频节奏完美匹配,增强了视频的整体观赏性和真实感。 借助先进的FrameEncoding模块,EMO能够在视频生成过程中始终保持角色身份的一致性。这意味着无论视频内容如何变化,角色的外观始终与输入的参考图像保持一致,增强了视频的连贯性和真实感。 为了提高视频生成的稳定性,EMO采用了多种控制机制,包括速度控制器和面部区域控制器等。这些机制有效避免了视频崩溃等问题,确保了视频生成的顺利进行。 生成视频 在推理阶段,EMO运用DDIM采样算法,通过迭代去噪过程,生成与输入音频同步的肖像视频片段。

    82410编辑于 2024-03-07
  • 视频翻译太贵太慢?AI 一键译制把成本降到人工的 110

    摘要 一条10分钟海外宣传片走传统人工译制要等3-5天、花几千块,每改一版还要重来。 交期永远对不上档期:译制公司排期普遍 3-5 天起,遇到节日、促销档期,甚至要排到一周以后。而你运营侧的活动节奏是"今晚上线、明早投放",节奏完全接不上。 多语种质量参差不齐:不同语种找不同的译员和配音,风格、音色、术语不统一,观众在你的 YouTube、TikTok 频道里会明显感到"这几条视频不像一个品牌的"。 知识课程 / 长视频:大模型翻译 + 基于音色 ID 配音 0.5 元/分钟,总成本可控,长视频最怕的就是配音贵。 视频翻译不该再是出海路上最贵、最慢的那一环。把人工译制链路重构成"ASR + 大模型翻译 + 术语库 + AI 配音 + 字幕压制"的分钟级流水线,是腾讯云媒体 AI 在做的事。

    34610编辑于 2026-06-01
  • 视频配音太折腾?实测7款工具,这3款让我彻底告别会员套路

    视频这几年,我在配音上踩过的坑能写满一页纸。自己录音嗓子受不了,充了会员发现好听的音色还要单独买,免费导出每隔10秒喊一句“本音频由XX制作”。直到2026年,我终于找到了一套不再折腾的组合方案。 花了300多个小时,我把市面上7款主流配音工具从头到尾测了一遍。今天按不同视频类型分开说,你做哪类内容,就直接看哪个。 每天登录送免费时长,一条3-5分钟的视频基本不花钱。偶尔做长片,签到两天也够了。一句话:日更影视解说、知识科普、高燃混剪的首选。月花费0元。 五、完全免费的应急方案→叮叮配音手机里常备的一款。完全免费,不限字数、不限时长,导出没有广告也没有水印。5000字文稿、40分钟播客、一天连导20条视频,全部免费。 :约207元八、一句话总结2026年做视频配音,别再乱充会员了。

    72210编辑于 2026-05-13
  • 视频剪短视频太费时?智能拆条+AI二创实现批量产出的秘密

    :剪辑师手动抓主体很累,出效果的前提是"愿意认真调"; 二次创作(解说/二创)更贵:配音、加解说词、字幕对齐,一条工期翻倍; 合规复核不敢省:人工过一遍每条视频,又是一道成本。 环节 7:AI 解说二创——3 元/分钟 解决的问题:直接从长视频生成带解说的二创短视频——把"剪辑+配解说词+配音"三步合并成一步。 适用场景: 新闻事件二创(热点解读、要点梳理); 知识课程浓缩(1 小时课浓缩成 3-5 分钟精华); 影视剧情解说; 赛事回放复盘。 模板 2:知识付费——长课精华化流水线 输入:课程库数百小时长视频 目标:将每节课浓缩成 3-5 分钟精华片段,形成知识短视频矩阵 流水线: 智能拆条大模型版拆按知识点; AI 解说二创(3 元/分钟) 长视频剪短视频"剪不完"的根源从来不是剪辑师不够,而是链路没被工程化。把拆条、集锦、横转竖、字幕、配音、翻译、审核做成分钟级计价的标准环节,串成一条并行流水线,批量规模化产出就不再是难题。

    54910编辑于 2026-06-01
  • 视频配音翻译多角色识别Speaker Diarization 工程实践与踩坑记录

    重点不是介绍一个工具,而是解释为什么 diarization 在视频配音翻译里经常出错,以及怎么把错误压到后续配音流程能接受的范围内。为什么短剧里的 diarization 更容易翻车? 一条可落地的多角色识别 pipeline在视频翻译配音里,speaker diarization 通常不应该直接吃原始视频音轨。 接入视频翻译 pipeline 时要注意什么?在视频翻译配音里,diarization 的输出不是给人看的终点,而是给下游模块使用的结构化输入。 在实际项目中,我们把这套 diarization 方案集成到一条视频翻译 pipeline 里时,最大的收益不是“自动识别出几个 speaker”,而是让后续 AI 配音和声音克隆有了更稳定的角色轨道。 VividDub 这类视频本地化工作流,正是把 AI 视频翻译、AI 配音、字幕生成、硬字幕擦除和多语种输出放在同一条链路里处理,适合持续做短剧、课程、营销视频和内容库本地化。

    29500编辑于 2026-05-27
  • 免费配音软件哪个好?2026年腾讯云TTS + 4款工具,从验证到生产全流程

    更值得关注的是对话式TTS的上线——基于TRTC实时音视频打造,首包延迟低至300ms,支持声音克隆与多语种。这意味着AI配音正在从“批量生产”走向“实时对话”。 “爱小悠”情感丰富,韵律语调舒适;“智小解”语言流畅利落,适合视频解说。1.2对话式TTS:实时场景的新选择2026年5月,腾讯云上线了对话式TTS,基于TRTC实时音视频打造。 此外,TRTC新账号可免费领取10000分钟音视频时长。 关键能力:音色超过1000种,分类细致,可直接输出VoiceType映射表音频转文字一键导出带时间轴的SRT字幕每日免费额度约3-5分钟提供RESTfulAPI在协同流中的角色:制作带字幕的样片,验证音色与时间轴匹配 六、综合对比工具平台免费策略音色数API在协同流中的角色腾讯云TTS云API800万字符46种✅规模化生产引擎配朵朵网页+小程序+APP每日3-5分钟1000+✅样片+字幕验证叮叮配音小程序不限字数/时长

    54710编辑于 2026-06-18
  • 如何配音更有辨识度?2026年腾讯云TTS声音克隆+4款免费工具协同全记录

    做个人IP的创作者都有一个共同的痛点:想让所有视频都用"自己的声音",但自己录太累了。我之前做一个数码评测号,每条视频的旁白都自己录。 架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说"每次声音都不一样,记不住你"。 :每日登录送免费时长,约3-5分钟视频音色数量:超过1000种附加功能:AI写作、音频转文字(SRT)、视频转文字、格式转换平台:网页+小程序+APP在协同流中的角色:完整样片制作+字幕时间轴验证。 APP每日3-5分钟配音+字幕一体化样片制作+字幕验证布丁配音小程序完全免费极速出稿语速/停顿参数验证七、选型建议2026年配音软件怎么选? 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音,5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    37710编辑于 2026-06-22
  • 来自专栏CoderJia的工作笔记

    KrillinAI:基于AI大模型的一站式视频翻译配音解决方案

    随着大语言模型(LLM)技术的迅猛发展,一款名为KrillinAI的开源工具横空出世,为内容创作者带来了革命性的视频翻译与配音解决方案。 项目概述 KrillinAI是一款基于AI大模型技术的全流程视频翻译和配音工具,旨在为内容创作者提供从视频下载到最终成品的一站式解决方案。 凭借其简洁而强大的设计,KrillinAI能够无缝处理从翻译、配音视频格式转换的全流程,支持将视频内容适配至各大主流平台,如YouTube、TikTok、抖音、哔哩哔哩、小红书等。 智能视频合成与格式转换 KrillinAI的视频处理能力不仅限于字幕和配音,还包括视频格式的智能转换。系统能够自动处理横屏和竖屏视频的转换,优化不同平台的显示效果。 配音合成模块:支持多种TTS(文本转语音)引擎,实现自然流畅的语音合成和声音克隆。 视频合成模块:处理字幕嵌入、音频替换和视频格式转换,生成最终成品。

    2.2K10编辑于 2025-04-16
  • 2026年配音工具技术选型:从轻量人工到腾讯云TTS的全栈方案

    在开发视频自动配音、短剧角色生成、智能语音交互等应用时,TTS(文本转语音)是核心依赖之一。对于开发者,常常面临一个抉择:轻量人工工具操作便捷但无法自动化;云API功能强大但前期验证成本高。 停顿是否合适完全免费,适合项目初期零成本试错为后续API选型提供音色风格参考(例如“悬疑片该用哪种voice_type”)1.2配朵朵——人工效率工作站平台:网页+微信小程序免费额度:每日登录送免费时长(约3- 5分钟视频)音色数量:1000+,按“悬疑解说”“电影预告”“史诗旁白”“电竞解说”分类附加功能:AI写作、音频转文字(SRT)、视频转文字、格式转换生成速度:约1分钟/次多角色能力:手动切换不同音色开发者 /创作者价值:音频转文字功能可快速生成带时间轴的SRT字幕,用于制作双语视频或辅助测试集标注音色分类清晰,便于快速定位合适的声音风格每日免费额度足够个人日更使用1.3媒小三配音——短剧多角色与声音克隆验证器平台 三、分层组合建议项目阶段推荐方案成本适用场景需求验证叮叮配音+配朵朵0元快速测试音色、文案、字幕效果短剧/多角色验证媒小三配音(免费试用)0元确定角色声线映射小批量人工制作配朵朵(每日免费)0元日更视频

    55610编辑于 2026-05-06
  • 2026年配音工具避坑指南:腾讯云TTS声音克隆+4款免费工具,个人IP批量生产

    做个人IP的创作者都有一个共同的痛点:想让所有视频都用“自己的声音”,但自己录太累了。我之前做一个数码评测号,每条视频的旁白都自己录。 架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说“每次声音都不一样,记不住你”。 :每日登录送免费时长,约3-5分钟视频音色数量:超过1000种,按“悬疑解说”“电竞解说”“史诗旁白”等分类附加功能:AI写作、音频转文字(SRT)、视频转文字、格式转换平台:网页+小程序+APP在协同流中的角色 APP每日3-5分钟配音+字幕一体化样片制作+字幕验证布丁配音小程序完全免费极速出稿语速/停顿参数验证七、选型建议2026年配音软件怎么选? 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音,5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    63510编辑于 2026-06-22
  • 2026年腾讯云TTS声音克隆实战:6秒录音克隆自己的声音,API批量生产全记录

    做个人IP的创作者都有一个共同的痛点:想让所有视频都用"自己的声音",但自己录太累了。我之前做一个数码评测号,每条视频的旁白都自己录。 架麦克风、找安静环境、读错一个字重录一整句,一条5分钟的视频配音就要折腾两三个小时。后来改用通用AI音色,速度是快了,但粉丝说"每次声音都不一样,记不住你"。 :每日登录送免费时长,约3-5分钟视频音色数量:超过1000种附加功能:AI写作、音频转文字(SRT)、视频转文字、格式转换平台:网页+小程序+APP在协同流中的角色:完整样片制作+字幕时间轴验证。 APP每日3-5分钟配音+字幕一体化样片制作+字幕验证布丁配音小程序完全免费极速出稿语速/停顿参数验证七、选型建议2026年配音软件怎么选? 以声音克隆为目标时:需要打造个人IP、所有视频用自己声音→腾讯云TTS声音克隆,6秒录音即可克隆,API批量生产需要验证录音质量和克隆效果→媒小三配音,5-10秒录音预览克隆效果需要多设备音色测试→叮叮配音

    42710编辑于 2026-06-22
领券