公司动态
Large Language Models for the Summarization of Czech Documents: From History to the Present
文章核心总结与创新点主要内容本文聚焦捷克语文本摘要任务(涵盖现代和历史文本),针对捷克语作为中资源语言、形态复杂且历史文本缺乏高质量数据集的问题展开研究。通过采用先进大语言模型(Mistral 7B、mT5)和创新的翻译-摘要-翻译(TST)方法,在现有现代捷克语摘要数据集SumeCzech上进行实验,同时构建并发布了历史捷克语文本摘要数据集Posel od Čerchova(POC),为捷克语摘要研究提供了新的基准和资源支持,最终推动捷克语(尤其是历史捷克语)文本摘要在数字人文、文化遗产保护等领域的应用。创新点模型应用突破:首次将Mistral 7B和mT5等大语言模型应用于捷克语文本摘要,在SumeCzech数据集上实现了最先进(SOTA)性能,验证了多语言大语言模型对形态丰富的中资源语言的有效性。翻译辅助方法:提出TST方法,通过将捷克语文本先翻译为英语,利用英语摘要模型生成摘要后再翻译回捷克语,为低/中资源语言摘要任务提供了高效的替代方案。历史数据集构建:创建了首个针对历史捷克语文本摘要的数据集Posel od Čerchova,该数据集源自19世纪期刊,包含页面级(POC-P)和文章级(POC-I)两种摘要,填补了历史捷克语摘要资源的空白。跨领域支持:同时覆盖现代和历史捷克语摘要任务,提供了统一的实验框架和基线结果,为后续低资源语言摘要、历史文本处理研究奠定基础。