公司动态
XTREME 句子检索任务解密:BUCC 与 Tatoeba 如何评估多语言句子嵌入?
XTREME 句子检索任务解密BUCC 与 Tatoeba 如何评估多语言句子嵌入【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtremeXTREME 是一个衡量预训练多语言模型跨语言泛化能力的权威基准Benchmark覆盖 40 种语言、9 大任务。其中句子检索Sentence Retrieval是检验多语言句子嵌入质量最直观的试金石而它正是由BUCC 2018与Tatoeba两个任务共同承担的。本文面向新手用通俗的方式拆解这两个任务的评估逻辑、数据格式与运行方法帮助普通用户快速读懂 XTREME 榜单上这两项分数的含义。什么是多语言句子嵌入为什么需要评估它多语言句子嵌入Multilingual Sentence Embedding就是把不同语言的句子映射到同一个向量空间意思相同的句子无论用中文、法语还是俄语表达得到的向量都应该彼此靠近。BUCC 与 Tatoeba 正是评估这种跨语言对齐能力的两个标准任务它们不需要模型做任何微调直接用预训练模型的表征来计算相似度因此能最真实地反映模型底层表示的质量。BUCC 2018从海量语料中挖出平行句对BUCC 任务的核心目标BUCCBuilding and Using Parallel Corpora2018 是经典的**双语平行语料挖掘Bitext Mining**任务。简单来说给定两种语言各一批句子模型要判断哪些句子互为翻译。XTREME 使用其中 4 个语言对英语-法语en-fr、英语-德语en-de、英语-俄语en-ru和英语-中文en-zh。BUCC 如何计算得分F1 指标的玄机BUCC 的评估指标是F1 分数它综合了精确率Precision找出的句对里有多少是对的和召回率Recall真正的句对里找回了多少。模型先为每个候选句对打分排序再用双向最近邻forward/backward KNN与 margin ratio 策略挑选互译句对最后与人工标注的黄金对齐gold alignment比对得出 F1。一键运行 BUCC 评估运行脚本位于 scripts/run_bucc2018.sh只需一条命令即可对 4 个语言对完成评估bash scripts/run_bucc2018.sh bert-base-multilingual-cased 0脚本内部调用 third_party/evaluate_retrieval.py 提取句子嵌入、执行 third_party/utils_retrieve.py 中的mine_bitext挖掘与bucc_eval评分。测试标签文件可在 mock_test_data/labels/bucc2018 中查看格式为源语言ID目标语言ID的句对列表。Tatoeba36 种语言的句子配对游戏Tatoeba 任务的核心目标Tatoeba 检索任务更简单直接每个语言对包含 1000 条平行句对模型要用一条语言的句子去检索另一条语言的对应翻译。它覆盖多达36 种语言如日语、泰语、斯瓦希里语等低资源语言是检验模型在稀缺语言上泛化能力的绝佳测试。Tatoeba 如何计算得分Accuracy 的简单之美Tatoeba 使用top-1 检索准确率Accuracy对每条句子用 faiss 在另一个语言的句子集合中做最近邻搜索若得分最高的候选恰好是正确翻译则计 1 分最终取平均值。你可以参考 scripts/run_tatoeba.sh 中 36 种语言的完整循环逻辑其相似度计算基于 cosine 距离。Tatoeba 标签文件的正确理解注意 mock_test_data/labels/tatoeba 中的标签文件是一列数字如957、981这些是目标语言句子的索引序号代表每条源语言句子对应的正确翻译位置而非句子本身。模型评估的三个关键设置无论 BUCC 还是 Tatoeba评估流程都共享三个核心设置理解它们有助于你解读结果池化方式Pooling默认使用 CLS token 向量作为整句表示也可切换为 mean pooling见 evaluate_retrieval.py 中的cls_pool_embedding与mean_pool_embedding函数。指定层嵌入BERT 类模型通常取第 7 层、XLM-R 取第 13 层的隐藏状态因为中间层往往比最后一层更适合检索任务。faiss 索引加速底层用 faiss 库做 GPU/CPU 近邻搜索utils_retrieve.py 的knnGPU/knnCPU支持 cosine 与 L2 两种距离度量。新手常见疑问速答问BUCC 的 F1 和 Tatoeba 的 Accuracy 哪个更能说明模型好坏两者互补。BUCC 考验模型在大规模噪声数据中精准配对的能力对召回和精确都敏感Tatoeba 则测低资源语言的 top-1 检索精度更贴近翻译、搜索等真实场景。问想复现榜单成绩需要准备什么只需预训练模型如bert-base-multilingual-cased、xlm-roberta-large与下载好的数据无需任何微调。如果想先跑通流程可以直接使用本仓库mock_test_data中的示例标签与预测文件通过 evaluate.py 快速验证评测管线。问提交到 XTREME 榜单的预测文件长什么样在预测文件夹中按bucc2018、tatoeba等子目录组织文件命名为test-{语言}.tsv可参考 mock_test_data/predictions 的目录结构。小结一句话读懂两项指标BUCC 用 F1 衡量挖平行语料的精准与全面Tatoeba 用 Accuracy 衡量跨语言找句子的命中率——两者共同构成了 XTREME 对多语言句子嵌入质量的双重视角。理解这两个任务你就掌握了读懂多语言模型检索能力的一把钥匙。【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考