公司动态
VecMap 数据准备全攻略:get_data.sh 一键下载多语言词嵌入与词典
VecMap 数据准备全攻略get_data.sh 一键下载多语言词嵌入与词典【免费下载链接】vecmapA framework to learn cross-lingual word embedding mappings项目地址: https://gitcode.com/gh_mirrors/ve/vecmapVecMap 是一个用于学习跨语言词嵌入映射cross-lingual word embedding mappings的开源框架能把不同语言的词嵌入对齐到同一个共享空间从而支撑双语词典归纳、跨语言相似度计算等经典任务。对新手而言最花时间的往往不是算法本身而是准备多语言词嵌入与双语词典数据。好在项目提供了 get_data.sh 脚本一条命令即可下载论文使用的全套数据让你快速进入实战环节。为什么说数据准备是跨语言词嵌入的第一步想要训练跨语言词嵌入映射你至少需要两类输入单语词嵌入每种语言独立的词向量文件双语词典源语言与目标语言单词的对照表训练用。自己训练词向量、再手工整理词典既耗时又容易踩坑。VecMap 官方贴心地提供了 get_data.sh 一键下载脚本把论文中用到的标准数据集全部下载好目录结构自动创建开箱即用。get_data.sh 一键下载脚本能拿到哪些数据五种语言的高质量词嵌入 脚本会自动下载**英语en、意大利语it、德语de、芬兰语fi、西班牙语es**五种语言的词嵌入均为 300 维、word2vec 文本格式与你用 word2vec 或 fastText 训练出的格式完全一致可直接被 embeddings.py 读取。双语训练与测试词典dictionaries.tar.gz中包含多组语言对的训练词典用于学习映射和测试词典用于评测每行一个词对格式为源语言单词 目标语言单词。相似度与类比评测数据集单词类比数据questions-words.txt来自 Mikolov 等人的经典数据集跨语言相似度数据 RG65英德、MWS353英德、英意用于评测跨语言词相似度。运行前准备环境要求与快速获取项目代码在运行脚本前请确认环境满足以下依赖详见 README.md依赖说明Python 3必选NumPy必选SciPy必选CuPy可选仅在需要 GPU 加速时安装获取项目代码也很简单git clone https://gitcode.com/gh_mirrors/ve/vecmap cd vecmap一键下载步骤get_data.sh 具体怎么用进入项目目录后直接执行./get_data.sh脚本会自动完成以下工作创建data/目录及embeddings、dictionaries、analogies、similarity四个子目录依次下载五种语言的词嵌入压缩包并解压为纯文本格式下载并解压双语词典、相似度与类比数据集自动清理临时压缩包保持目录整洁。整个过程全自动无需任何人工干预真正实现一键下载多语言词嵌入与词典。下载完成后data 目录结构一目了然脚本执行完毕后你会得到如下目录结构data/ ├── embeddings/ # 五种语言的词嵌入文件 ├── dictionaries/ # 双语训练/测试词典 ├── analogies/ # 单词类比评测数据 └── similarity/ # 跨语言相似度评测数据对应到 get_data.sh 脚本中你会发现它先通过mkdir -p创建目录再用wget下载、gunzip解压、unzip/tar提取文件逻辑清晰也方便你按需修改。词嵌入文件格式看懂 en.emb.txt以data/embeddings/en.emb.txt为例文件采用标准的 word2vec 文本格式第一行词表大小 向量维度例如200000 300之后每一行单词 向量分量1 向量分量2 ...。VecMap 的读写逻辑封装在 embeddings.py 的read/write函数中。如果你有自训的词向量按这个格式组织文件即可直接使用。拿到数据后如何训练跨语言词嵌入映射数据就绪后就可以用 map_embeddings.py 训练映射了。以有大量训练词典的监督模式为例python3 map_embeddings.py --supervised \ data/dictionaries/en-es.train.txt \ data/embeddings/en.emb.txt \ data/embeddings/es.emb.txt \ en_mapped.emb es_mapped.emb训练完成后还可以用 eval_translation.py 在测试词典上评测双语词典归纳效果推荐使用 CSLS 检索python3 eval_translation.py en_mapped.emb es_mapped.emb \ -d data/dictionaries/en-es.test.txt --retrieval csls常见问题与排查技巧脚本提示权限不足先执行chmod x get_data.sh赋予执行权限下载速度慢或失败部分数据源位于境外服务器网络波动时重试即可脚本内部使用wget -q静默下载你也可以去掉-q参数查看详细进度想用自己的数据无需修改脚本把自训词向量转换成 word2vec 文本格式、词典整理成每行一个词对替换对应文件即可。小结从数据准备到跨语言词嵌入实战VecMap 的数据准备并没有想象中复杂。get_data.sh 帮你一键搞定多语言词嵌入、双语词典和评测数据配合 map_embeddings.py 与 eval_translation.py 即可完成下载 → 训练 → 评测的完整闭环。现在就去试试吧让你的跨语言词嵌入项目快速跑起来【免费下载链接】vecmapA framework to learn cross-lingual word embedding mappings项目地址: https://gitcode.com/gh_mirrors/ve/vecmap创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考