/传播易/9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。
Spark-Audio-1.0-Preview支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,覆盖99种语言及202种方言识别,使智能语音完成从“听清”到“听懂”的跃升。
在训练数据量仅相当于同尺寸模型Qwen3.5-omni-Flash十分之一的情况下,Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在偏真实应用类任务上明显领先,与尺寸更大的闭源语音基座模型效果接近。Spark-Audio-1.0-Preview整体上在多语言、多方言、复杂场景下的高噪声和小音量任务中有更好的表现。
据了解,作为业界首个基于全国产算力训练的语音基座大模型,Spark-Audio-1.0-Preview通过音频编码器预训练,逐步扩展音频编码器的表征能力;再通过预训练和后训练,提升了模型的基础能力、复杂场景泛化性以及多个任务效果。
目前,Spark-Audio-1.0-Preview正式开放体验,API后续将上线讯飞开放平台;基于Spark-Audio-1.0-Preview语音基座大模型,科大讯飞还将在近期陆续展开一系列语音相关大模型的发布和升级。
最新文章
当企业需求不只是&quo 09-16
红启新章,匠心七载 | 09-16
恒生活GRABOT首次登 09-16
NanoH2O 推出新一 09-16
高交会“大能源”巨头云集 09-16
焱融科技领跑中国独立全栈 09-16
CHH机王争霸赛硬核登场 09-16
行业首次!DeepWay 09-16
中秋国庆全家观影,海信小 09-16
三星Galaxy Z8系 09-16





