Krafton已在全球AI平台Hugging Face上发布最新音频基础模型A.X K2 Raon-Speech。作为SK电信财团成员,Krafton参与了韩国科学技术信息通信部(MSIT)的独立AI基础模型项目,并主导下一代多模态模型研发。
A.X K2 Raon-Speech基于现有的Raon-Speech模型构建,融合了Krafton专有的语音编码器与音频编解码器,并依托SK电信的A.X K2打造紧凑型语言模型,实现了对语音的直接处理与生成。
该模型参数量达210亿。数据显示,其在韩国模型中排名第一,在参数量低于300亿的英语模型中位列第三。评估覆盖语音识别、合成、理解、口语问答、文本问答及工具使用六大领域,测试基准包含LibriSpeech、KSponSpeech和VoiceBench在内的24个韩语及22个英语数据集。
传统对话式音频系统通常采用“语音转文本-生成回复-文本转语音”的流程,易丢失情感、语调和语气等信息。A.X K2 Raon-Speech旨在保留这些细微线索,生成更自然、拟人化的语音回复。
Krafton计划将该技术应用于其AI驱动的协同可玩角色(NPC),以提升游戏过程中的对话自然度与响应能力。此次发布紧随今年4月Krafton旗下Raon品牌推出Raon-Speech、Raon-SpeechChat、Raon-OpenTTS和Raon-VisionEncoder四款开源模型之后。
Krafton首席AI官李康宇表示,A.X K2 Raon-Speech体现了公司对核心AI技术的持续优化,未来将继续推进基础模型发展,以创造全新的游戏体验。
【星途科讯 图文丨Patrick 首发于ZAKER科技,转载请注明出处】