公司动态
SPECTER2_aug2023refresh_base训练秘籍:从600万引文三元组到高效适配器微调
SPECTER2_aug2023refresh_base训练秘籍从600万引文三元组到高效适配器微调【免费下载链接】specter2_aug2023refresh_base项目地址: https://ai.gitcode.com/hf_mirrors/LLM-Research/specter2_aug2023refresh_baseSPECTER2_aug2023refresh_base是一款基于科学文献的强大嵌入模型作为SPECTER的升级版本它通过适配器微调技术实现了科学任务的高效适配。本文将揭秘其从600万引文三元组训练到适配器微调的完整流程帮助新手快速掌握这一终极科学嵌入工具。什么是SPECTER2_aug2023refresh_baseSPECTER2_aug2023refresh_base是Allen AI开发的科学文献嵌入模型基于bert-base-uncased架构与适配器技术构建。它能够将科学论文的标题和摘要转换为高质量向量表示支持分类、回归、 proximity搜索等多种科学任务。该模型是SPECTER2系列的基础编码器需要与特定任务的适配器配合使用才能发挥最佳性能。2023年8月更新版本在扩展的引文数据集上进行了重新训练包含了更多近期发表的学术论文。600万引文三元组训练数据的核心秘密数据集构成SPECTER2_aug2023refresh_base的基础模型训练基于超过600万条科学论文引文三元组这些数据来自allenai/scirepeval数据集。每个三元组包含查询论文query正引用论文pos负引用论文neg数据格式示例{query: {title: ..., abstract: ...}, pos: {title: ..., abstract: ...}, neg: {title: ..., abstract: ...}}其中负样本可能来自与查询论文相同/不同研究领域或引用的引用等多种类型确保模型学习到鲁棒的科学文献关系表示。数据预处理训练数据采用标题和摘要拼接的方式构建输入文本text_batch [d[title] tokenizer.sep_token (d.get(abstract) or ) for d in papers]所有文本被处理为最大长度512的序列使用SciBERT的词汇表进行分词。两阶段训练从基础模型到适配器微调阶段一基础模型训练基础模型在600万引文三元组上进行预训练关键超参数包括批大小1024最大输入长度512学习率2e-5训练轮次2预热步数10%混合精度fp16这一阶段使模型学习到科学文献的基础表示能力能够捕捉论文间的引用关系和主题相关性。阶段二适配器微调在基础模型之上针对四种任务格式训练了专用适配器分类Classification回归RegressionProximity邻近性搜索特定查询Adhoc Search适配器训练额外加入了60万采样三元组超参数设置为批大小256学习率1e-4训练轮次6预热步数1000混合精度fp16这种两阶段训练策略既保留了基础模型的通用科学知识又通过适配器实现了对特定任务的高效微调。快速开始适配器使用指南环境准备首先克隆项目仓库git clone https://gitcode.com/hf_mirrors/LLM-Research/specter2_aug2023refresh_base安装所需依赖transformersadapterstorch基础使用代码以下是加载模型和适配器的基本示例from transformers import AutoTokenizer from adapters import AutoAdapterModel # 加载分词器 tokenizer AutoTokenizer.from_pretrained(allenai/specter2_aug2023refresh_base) # 加载基础模型 model AutoAdapterModel.from_pretrained(allenai/specter2_aug2023refresh_base) # 加载并激活适配器 model.load_adapter(allenai/specter2_aug2023refresh, sourcehf, load_asproximity, set_activeTrue) # 准备输入数据 papers [ {title: BERT, abstract: We introduce a new language representation model called BERT}, {title: Attention is all you need, abstract: The dominant sequence transduction models are based on complex recurrent or convolutional neural networks} ] # 拼接标题和摘要 text_batch [d[title] tokenizer.sep_token (d.get(abstract) or ) for d in papers] # 预处理输入 inputs tokenizer(text_batch, paddingTrue, truncationTrue, return_tensorspt, return_token_type_idsFalse, max_length512) # 获取嵌入 output model(**inputs) embeddings output.last_hidden_state[:, 0, :] # 取第一个token作为嵌入任务专用适配器选择根据不同下游任务选择合适的适配器任务类型适配器名称用途Proximityallenai/specter2_aug2023refresh链接预测、近邻搜索Adhoc Queryallenai/specter2_aug2023refresh_adhoc_query短文本查询编码Classificationallenai/specter2_aug2023refresh_classification分类任务特征提取Regressionallenai/specter2_aug2023refresh_regression回归任务特征提取对于未明确列出的任务类型Proximity适配器通常能提供良好的基础性能。性能评估科学嵌入的新标杆SPECTER2_aug2023refresh_base在多个科学文献任务上建立了新的性能基准模型SciRepEval平均得分MDCR(MAP, Recall5)SPECTER68.0(30.6, 25.5)SciNCL69.0(32.6, 27.3)SPECTER2-Adapters71.2(38.4, 33.0)特别是在MDCR引文推荐任务上SPECTER2_adapters实现了38.4的MAP和33.0的Recall5显著优于之前的所有模型。总结科学文献嵌入的终极工具SPECTER2_aug2023refresh_base通过600万引文三元组的预训练和任务专用适配器的微调为科学文献嵌入任务提供了强大而灵活的解决方案。其主要优势包括高效适配通过适配器技术实现对不同任务的快速适配无需重新训练整个模型科学领域优化在大规模科学文献数据上训练专门针对学术论文表示优化多种任务支持支持分类、回归、搜索等多种科学文献相关任务性能领先在多个科学文献基准测试中建立新的性能标准无论是进行科学文献检索、引用推荐还是学术论文分类SPECTER2_aug2023refresh_base都能提供简单而强大的工具支持是科研工作者和开发者处理科学文献数据的理想选择。引用与致谢如果您在研究中使用了SPECTER2_aug2023refresh_base请引用以下论文inproceedings{specter2020cohan, title{{SPECTER: Document-level Representation Learning using Citation-informed Transformers}}, author{Arman Cohan and Sergey Feldman and Iz Beltagy and Doug Downey and Daniel S. Weld}, booktitle{ACL}, year{2020} } inproceedings{Singh2022SciRepEvalAM, title{SciRepEval: A Multi-Format Benchmark for Scientific Document Representations}, author{Amanpreet Singh and Mike DArcy and Arman Cohan and Doug Downey and Sergey Feldman}, booktitle{Conference on Empirical Methods in Natural Language Processing}, year{2022} }本项目由Allen AI开发采用Apache 2.0许可证开源。【免费下载链接】specter2_aug2023refresh_base项目地址: https://ai.gitcode.com/hf_mirrors/LLM-Research/specter2_aug2023refresh_base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考