公司动态
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
一、文章主要内容总结本文介绍了首个专为东南亚(SEA)语言设计的大型音频-语言模型(LALM)——SeaLLMs-Audio,以及配套的评估基准SeaBench-Audio。模型支持印尼语、泰语、越南语三种东南亚语言,同时兼容英语和中文,具备多模态输入(音频、文本、音频+文本)和多任务处理能力,涵盖语音识别(ASR)、音频描述、语音转文本翻译(S2TT)、情感识别、语音问答、语音摘要等音频理解任务,以及语音对话(事实查询、数学计算、常识问答)等交互任务。模型基于Qwen2-Audio-7B的音频编码器和Qwen2.5-7B-Instruct的多语言LLM模块构建,通过158万条多任务对话数据(含7%多轮对话)进行全参数微调,数据来源于公开数据集(如GigaSpeech、Common Voice)和私有数据,经统一格式、补全标点、翻译适配等预处理后用于训练。为解决东南亚语言音频模型缺乏标准化评估的问题,作者构建了SeaBench-Audio基准,包含14个任务(涵盖音频+文本输入、纯音频输入两类场景),共580个问题,由专业母语学者标注并制定任务专属评估标准。实验表明,SeaLLMs-Audio在东南亚三种语言的任务表现和语言质量上均优于Qwen2-Audio、MERaLiON等同类模型,且采用的“LLM-as-a-judge”评估框架与人类评估的相关性达0.8、一致性达69%(含平局)/93%(不含平局),可靠性较高。二、文章创新点首个东南亚专用多语言音频-语言模型:填补了现有LALM多集中于英语、缺乏东南亚语言支持的空白,同时兼容中英双语,支持多模态输入和多样化音