公司动态

50+推理基准数据集速查清单:Awesome-Reasoning-Foundation-Models让你快速掌握LLM评测全貌

📅 2026/8/24 17:32:37
50+推理基准数据集速查清单:Awesome-Reasoning-Foundation-Models让你快速掌握LLM评测全貌
50推理基准数据集速查清单Awesome-Reasoning-Foundation-Models让你快速掌握LLM评测全貌【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models面对琳琅满目的推理基准数据集不知道做LLM评测该选哪一套Awesome-Reasoning-Foundation-Models是一个开源的推理基准与LLM评测资源库一站式整理100 推理基准数据集与 300 前沿论文覆盖常识、数学、逻辑、因果、视觉等 8 大推理任务帮你 10 分钟看懂大模型推理能力评测的全貌。为什么 LLM 评测需要一份推理基准数据集速查清单如果你正在挑选大模型、或者想评估 GPT、Llama、Qwen 这类模型的推理能力大概率遇到过这些困扰 基准太多记不住GSM8K、HellaSwag、BIG-bench、CLEVR……名字看过去一脸懵 任务划分不清晰常识推理和数学推理到底有什么区别该测哪几个 信息更新快每月都有新基准发布手动整理要花好几天这份开源仓库就是为解决这些问题而生的。它基于 ACM 综述论文A Survey of Reasoning with Foundation Models整理把推理是什么、测什么、怎么测、怎么提升一次性讲清楚堪称一份免费的 LLM 评测全貌地图。项目速览Awesome-Reasoning-Foundation-Models 包含什么整个仓库结构非常轻量核心内容集中在 README.md 一份文档中建议配合本地文件README.md阅读共 4 大章节章节内容文件位置0 Survey综述论文出处与引用信息README.md第 0 节1 Relevant Surveys10 相关推理方向综述与链接README.md第 1 节2 Foundation Models语言/视觉/多模态三类基础模型GPT-4、Llama 2、Qwen、SAM、CLIP、LLaVA、Gemini 等README.md第 2 节3 Reasoning Tasks⭐ 核心8 大推理任务 100 基准数据集README.md第 3 节4 Reasoning Techniques6 大推理技术预训练、微调、对齐、MoE、ICL、自主智能体README.md第 4 节如上图所示推理任务中心圆盘被划分为常识、数学、逻辑、因果、视觉、多模态、具身智能和其他 8 大扇区右侧的推理技术预训练、微调、MoE、对齐训练、上下文学习、自主智能体则构成能力支撑——这正是你挑选基准数据集时的坐标系。快速上手3 步获取完整推理基准清单第 1 步克隆仓库git clone https://link.gitcode.com/i/7b953eafe50c119c64cb0810a0ea9dea.git第 2 步打开README.md顶部有完整目录Table of Contents按任务类别折叠展示点击即可跳转。第 3 步按需定位。每个基准条目都标注了年份 | 名称 | 论文标题 | 论文/代码/项目链接格式统一扫一眼就能判断是否适合自己。 提示仓库每月 1 号自动更新论文见CONTRIBUTING.md建议收藏后定期回看。50 推理基准数据集速查清单核心内容下面按 9 大任务类别整理代表性基准。加粗的是评测 LLM 时最常被引用的必测项完整列表见README.md对应小节。① 常识推理基准模型懂不懂世界运作方式基准数据集首发一句话定位HellaSwag2019完成句子的日常物理常识推理WinoGrande2019大规模对抗式 Winograd 语言指代推理SocialIQA2019社交场景中的常识行为推理PIQA2019自然语言物理常识问答CQA2018CommonsenseQA 知识问答挑战GQA2019真实场景视觉组合式问答PROST2021物体时空物理推理PHYRE2019物理规则推理新基准RAINBOW2021多任务常识推理统一基准SWAG2018大规模对抗式常识推理解释② 数学推理基准从小学应用题到定理证明基准数据集首发一句话定位GSM8K2021小学数学应用题LLM 数学能力标尺MATH2021竞赛级数学题 完整解题步骤MGSM2022多语言版 GSM8K测跨语言推理DROP2019段落离散推理阅读理解SQuAD2016经典阅读理解问答基准MAWPS2016小学数学题仓库FinQA2021金融数据数值推理TheoremQA2023定理驱动的数学问答MathBench2024多层次难度数学评测数据集SciBench2023大学水平科学问题求解MathVista2023视觉情境下的数学推理多模态③ 逻辑推理基准能否一步步演绎推理基准数据集首发一句话定位LogiGLUE2023语言模型逻辑推理能力统一基准BIG-bench2022谷歌超越模仿游戏综合能力基准含逻辑子任务FOLIO2022一阶逻辑自然语言推理AR-LSAT2021分析推理LSAT 风格文本推理ProofWriter2020自然语言蕴含、证明与溯因④ 因果推理基准分得清相关与因果吗基准数据集首发一句话定位CRASS2021反事实推理 LLM 新基准CauseEffectPairs2014因果 vs 效应方向判别基准Corr2Cause2023从相关性推断因果能力测试⑤ 视觉推理基准2D 图像与 3D 场景理解基准数据集首发一句话定位CLEVR2016组合式语言基础视觉推理诊断集OK-VQA2019需要外部知识的视觉问答VisuLogic2025多模态大模型视觉推理新基准SQA3D20223D 场景情境问答G-VUE2022感知-定位-推理-行动通用视觉基准⑥ 音频推理基准听懂语音与声音事件基准数据集首发一句话定位SUPERB2021语音处理通用性能基准SUPERB-SG2022增强语义生成能力版语音基准MLS2020大规模多语言语音数据集Common Voice2019众包多语言语音语料Libri-Light2019低监督 ASR 评测基准⑦ 多模态推理基准视觉 文本的联合能力基准数据集首发一句话定位POPE2023大视觉语言模型物体幻觉评测LVLM-eHub2023大视觉语言模型综合评测基准LAMM2023语言辅助多模态指令微调基准ARC / RAVEN2022概念抽象理解评测MatCha2022图表去渲染数学推理预训练Q-Bench2023低层视觉画质感知通用基准MultimodalOCR2023多模态模型 OCR 隐藏缺陷探测⑧ 智能体推理基准能否在真实环境中规划与行动基准数据集首发一句话定位Habitat / Habitat 2.02019/2021具身智能研究平台iGibson2021家庭日常任务机器人学习仿真BEHAVIOR-1K20221000 项日常活动的具身 AI 基准RoboTHOR2020仿真到真实的具身 AI 平台NuScenes-QA2023自动驾驶多模态视觉问答DriveLM2023图式视觉问答驱动的驾驶推理⑨ 其他垂直推理场景医疗、天气、长链推理基准数据集首发一句话定位MultiMedQA2022覆盖 28 个医学问答数据集的汇总Med-PaLM 系列CheXbench2024胸片解读智能体基准Pangu-Weather20233D 神经网络中期天气预报KACC2020知识抽象-具体化-补全多任务基准δ-NLI2020可废止 defeasible自然语言推理BoardgameQA2023矛盾信息下的自然语言推理使用建议新手评测 LLM 数学能力从GSM8K MATH起步测通用智能选BIG-bench / LogiGLUE做多模态模型选POPE LVLM-eHub做 Agent 选Habitat 系列。每个基准在README.md中都附了论文与代码直达链接点进去就能上手。三类基础模型你评测的选手是谁基准测的是考试模型才是考生。仓库第 2 章将基础模型分为三类选型时可以先对号入座语言基础模型LFMGPT-3 / GPT-4、ChatGPT、Llama 2、LLaMA、PaLM、Bard、Qwen、Mistral 等——LLM 评测的主力视觉基础模型VFMViT、SAM、Video-MAE V2、Stable Diffusion 等——支撑视觉推理类基准多模态基础模型MFMGPT-4V、Gemini、LLaVA、BLIP-2、InternVL、Qwen-VL 等——多模态推理评测对象每类模型条目均按发布日期 | 模型名 | 论文/代码/博客统一排版方便横向对比。6 大推理技术评测分低了怎么提升仓库第 4 章汇总了 6 类提升模型推理能力的主流技术路线评测前了解它们能帮你看懂模型报告中的提分手段技术路线代表方法适合场景预训练 Pre-TrainingTransformer、GPT 系列、CLIP 变体从零构建推理底座微调 Fine-TuningLoRA、QLoRA、MetaMath、WizardMath低成本适配推理任务对齐训练 AlignmentRLHF、DPO、InstructGPT让推理输出更符合人类偏好专家混合 MoEGLaM、Switch Transformers、MoE-LLaVA大参数规模高效推理上下文学习 ICLChain-of-Thought、Zero-shot-CoT、ToT思维树、Self-Consistency免训练最易上手的提分器自主智能体 AgentReAct、Reflexion、Voyager、HuggingGPT工具调用环境交互推理新手最快上手路径先用 Zero-shot-CoT提示词加一句Lets think step by step在 GSM8K 上试跑再对比启用 Self-Consistency 后的分数变化——这是理解推理技术如何影响基准分数的最短路径。清单如何保持更新如何参与贡献更新节奏每月 1 号例行更新论文与基准详见CONTRIBUTING.md贡献方式发现遗漏的基准/论文按CONTRIBUTING.md的格式提交 PR 或 Issue 即可授权许可项目附带LICENSE文件开源协议使用️配套图示assets/目录下提供上述 3 张全景图0_reasoning.jpg、1_overview.jpg、22_foundation_models.jpg可直接用于你的评测报告 PPT常见问题 FAQQ1我是纯文科背景 / 非开发者能用吗可以。整份清单是纯 Markdown 文档不需要写代码。把它当作LLM 能力考试大纲来读了解各基准在测什么即可。Q2清单里的基准数据是最新的吗仓库每月 1 号更新2024–2025 年的新基准如 MathBench、VisuLogic、PhyX均已收录是少数持续维护的推理基准清单。Q3和直接搜 arXiv 论文相比这份清单的优势是什么按任务类别 × 年份双重组织每条附论文/代码/项目三类链接且配套综述论文的方法论框架省去你在 300 论文中大海捞针的时间。写在最后一份好的推理基准数据集速查清单价值不在于罗列而在于对路。Awesome-Reasoning-Foundation-Models 用 8 大任务 6 大技术的框架把 LLM 评测这件事从信息焦虑变成了按图索骥——下次有人问你评测过哪些基准你大可以笑着甩出这份 100 清单。⭐ 觉得有用的话记得给仓库点个 Star让这份地图被更多人看到【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考