能听懂人类“弦外之音”,阶跃星辰再开源端到端语音大模型
创始人
2025-09-02 09:20:48
0

来源:市场资讯

(来源:澎湃新闻)

9月 1 日,“多模态卷王”阶跃星辰正式发布开源端到端语音大模型Step-Audio 2 mini,在多个国际基准测试集上取得SOTA(State-of-The-Art,当前最佳水平)成绩,在大部分任务上超越GPT-4o-audio。

技术层面,Step-Audio 2 mini采用了端到端多模态架构,将语音理解、音频推理与生成统一建模,时延更低、输出更快,还能更加精准地理解副语言信息、非人声信号等语音要素。Step-Audio 2 mini首创的音频推理能力,能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应。

同时,该模型支持语音原生的Tool Calling能力可实现联网搜索等操作,有效解决幻觉问题,并让语音模型具有知识储备和推理能力。

目前,Step-Audio 2 mini已在GitHub、Hugging Face等平台发布。(澎湃新闻记者 秦盛)

相关内容

热门资讯

2025年值得入手的2款智能手... 在科技飞速发展的今天,智能手表已成为我们生活中不可或缺的伙伴。无论是健康监测、信息提醒,还是时尚搭配...
原创 苹... 有不少朋友疑惑苹果iPhone 16 Pro和16 Pro Max有什么区别?该选择哪一款更好?各自...
第五轮学科评估对比:西安交大突... 在之前的文章中,我们已经提及西安交通大学第五轮学科评估的表现可圈可点,新晋的3个A+学科:机械工程、...
原创 2... 从去年华为用上了麒麟芯片开始,华为的市场份额就蹭蹭的往上涨,当时抢购的人特别多,一时间还买不到现货,...
steam官网无法访问?这个办... 对于广大游戏爱好者而言,Steam平台无疑是获取最新游戏资讯、购买游戏、与全球玩家互动的重要阵地。然...
解决FaceTime无法使用的... FaceTime是苹果公司推出的一款视频通话应用,广泛应用于iPhone、iPad和Mac等设备上。...
vivo手机5g开关在哪里打开 vivo手机5G开关的打开方式可能因手机型号、系统版本及运营商网络支持情况的不同而有所差异。但总体来...
2024年OPPO手机全攻略:... 手机已不仅仅是通讯工具,它更是我们记录生活、享受娱乐、提升工作效率的重要伙伴。随着科技的飞速发展,O...
原创 最... 近日,有关华为nova 13系列手机的消息开始多了起来,之前透露的消息暴露,华为nova 13 Pr...
2024信号“最可靠”的四款手... 大家好!今天我要和大家聊聊2024年信号“最可靠”的四款手机,它们分别是华为Pura 70 Pro+...