公司动态

ChineseErrorCorrector:中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力

📅 2026/8/25 9:45:50
ChineseErrorCorrector:中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力
ChineseErrorCorrector中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台集学术研究、模型训练、模型评测和推理部署于一体文本纠错新Sota。 2026 ACL Main Oral 项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrectorChineseErrorCorrector是一个面向中文文本纠错任务的综合平台集拼写纠错CSC与语法纠错CGEC的模型训练、评测、推理部署与数据增强于一体。其旗舰模型 ChineseErrorCorrector4-4B 荣获2026 ACL Main Oral在 NACGEC 与 CSCD 两大权威榜单刷新 SOTA全面超越 GPT-4。 项目定位一个平台覆盖中文纠错全流程对新手来说做中文纠错最大的痛点是东拼西凑——模型在 A 仓库、评测脚本在 B 仓库、训练数据在 C 仓库。ChineseErrorCorrector 把整条链路整合在一个平台里覆盖五大核心能力核心能力能做什么主要入口 学术研究持续更新的中文纠错论文清单README_paper.md 模型评测支持 80 种语言的通用纠错评测工具 Common Errantscores/README.md 推理部署4B 旗舰模型 可选 ELECTRA 字级门控加速main.py 数据增强14 种语法错误一键合成训练语料2024 CCL 冠军方案README_DAT.md 模型训练开源 34 万 COT、200 万监督数据等高质量语料data/它还曾斩获2024 CCL 冠军、2023 NLPCC-NaCGEC 纠错冠军、2022 FCGEC 纠错冠军学术与工程双料实力。 模型家族从 1.5B 轻量到 4B 旗舰怎么选平台提供从轻量到旗舰的完整模型矩阵按需选择即可模型纠错类型一句话说明ChineseErrorCorrector4-4B语法拼写ACL 2026 Main 论文模型双榜 SOTA超越 GPT-4ChineseErrorCorrector3-4B语法拼写200 万数据全量训练综合效果好ChineseErrorCorrector2-7B语法拼写200 万数据多轮迭代训练在 NaCGEC 超越华为 10 个点ChineseErrorCorrector-7B拼写专注音似、形似等拼写错误纠正ChineseErrorCorrector-1.5B拼写轻量款显存有限时首选ChineseErrorDetectorElectra字级检错门控轻量判别器先筛句再调大模型节省算力SOTA 成绩一览NaCGEC语法纠错ChineseErrorCorrector4-4B 取得F0.5 50.99第二名仅为 0.4526CSCD拼写纠错Correction F1 达59.61比 GPT-454.41高出 5.2 个点。 快速上手中文纠错模型部署三步走第 1 步获取代码并安装依赖git clone https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector cd ChineseErrorCorrector pip install -r requirements.txt第 2 步选择推理方式三选一transformers单机本地推理适合调试与小规模评测vLLM 异步批量推理工程推荐vllm serve启动模型后通过 OpenAI 兼容接口调用config.py中修改接口地址即可接入modelscope国内用户镜像下载更省事。第 3 步运行批量纠错python main.pyv4 旗舰模型的输出比上一代更透明——不仅给出纠正后的句子还额外返回错误类型和修改原因例如朋唷 → 朋友会被标注为错别字并解释是同音字误用。配置集中在 config.py 的TextCorrectConfig中接口地址、模型名、并发数都可以通过环境变量覆盖开箱即用。省钱技巧ELECTRA 字级门控加速大模型逐句生成成本高平台内置可选的轻量字级判别器先把句子过一遍 ELECTRA 门控只对疑似有错的句子调用 4B 大模型明显干净的句子直接跳过。在 config.py 中把USE_DETECTOR设为True即可启用门控逻辑见 electra_char_gate_infer.py详细说明见 README_ELECTRA.md。 数据增强14 种语法错误一键合成这是平台的隐藏杀手锏——2024 CCL 冠军方案的核心组件。如果你的领域语料医疗、法律、教育……缺少带错误的训练样本只需一条命令安装 PyPI 包即可在任意中文文本上注入 14 种语法错误from ChineseErrorCorrector.utils.dat import GrammarErrorDat dat GrammarErrorDat() dat.lack_word(小明住在北京) # 缺字漏字 dat.error_word(小明住在北京) # 错别字以祥子再度沉沦这句为例工具会随机选择 1~4 种错误进行注入去掉标点、把沦改成论等自动生成带标注的训练对。完整 API 见 dat.py使用文档见 README_DAT.md。14 种错误类型覆盖四大粒度每种都配有真实例句缺字漏字、错别字、标点问题、主语/谓语/宾语残缺与多余、语序不当、动宾搭配不当……基本覆盖了中文病句的常见类型。 模型评测Common Errant 通用纠错评测工具评测评测不用自己写脚本。平台内置Common Errant通用文本纠错评测工具支持中文、英文等高资源语言和印地语、孟加拉语等低资源语言共覆盖 80 种语言。评测流程很直接用 parallel_to_m2.py 把原文 标注 / 原文 预测转成 M2 评测文件用 compare_m2.py 对比参考与预测一键算出 F1 分数。各语言中文、英文、德语、乌克兰语、韩语等的编辑合并与错误分类规则都封装在 scores/ 对应语言目录下详细操作步骤见 scores/README.md。 模型训练用 LLaMA-Factory 微调你的纠错模型想在自有领域数据上训练纠错模型平台推荐业界主流框架LLaMA-Factory并提供了充足的弹药训练数据规模用途34 万 COT 数据集34 万带错误推理链用于训练 v4 旗舰模型200 万监督数据集200 万常规 (src, tgt) 监督对用于 v3 系列拼写纠错数据集CSCW271K / Medical / Lemon 等拼写方向专项训练语法纠错数据集CGCCGED / FCGEC / MuCGEC / NaCGEC语法方向专项训练Lang8HSK 混合语料156 万拼写语法混合选型建议有 COT 数据优先以 ChineseErrorCorrector4 为基座只有常规监督数据则推荐 ChineseErrorCorrector3 为基座。领域语料不足时先用上文的数据增强工具合成错误样本再喂给训练框架。训练完成后的权重用vllm serve加载把config.py里的OPENAI_MODEL改成自己的模型名即可无缝接入推理与评测流程。 关键文件导航文件作用main.py推理主入口ErrorCorrect.infer一键批量纠错config.py全部配置接口地址、模型版本、门控开关llm/infer/openai_infer.pyOpenAI 兼容接口调用与 v3/v4 输出解析llm/infer/electra_char_gate_infer.pyELECTRA 字级门控实现utils/dat.py14 种语法错误增强核心实现scores/Common Errant 评测工具80 语言data/训练数据、混淆字表等业务数据requirements.txt依赖清单❓ 新手常见问题Q1v3 和 v4 模型有什么区别v3 直接输出纠正后的句子v4ACL 2026 论文模型会先思考再纠错额外返回错误类型与修改原因平台会按模型名自动适配 prompt 并剥掉思考块对外接口完全一致。Q2显存有限能跑吗1.5B 轻量模型适合资源受限场景批量工程部署推荐 vLLM ELECTRA 门控组合可显著降低大模型调用次数。Q3可以直接商用吗可以。项目基于 Apache-2.0 协议开源学术与商业用途均允许保留版权与协议声明即可。✅ 总结ChineseErrorCorrector 把中文文本纠错的学、评、用、造装进了一个平台想用三种推理方式任选SOTA 旗舰模型开箱即得想评Common Errant 覆盖 80 种语言F1 一键出炉想造数据14 种语法错误一键增强冠军方案直接复用想训34 万 COT 200 万监督数据 LLaMA-Factory 路径全打通。无论是对中文纠错感兴趣的初学者还是要在生产环境落地纠错能力的工程师这个平台都值得 Star 收藏 ⭐。【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台集学术研究、模型训练、模型评测和推理部署于一体文本纠错新Sota。 2026 ACL Main Oral 项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考