公司动态

蚂蚁阿福Agent:医疗AI研发范式从传统到Agent的演进实践

📅 2026/7/28 20:42:17
蚂蚁阿福Agent:医疗AI研发范式从传统到Agent的演进实践
本文整理自 QCon北京 2026 郭春晓《蚂蚁阿福Agent医疗研发范式与实践》技术分享通过AI音视频转录总结工具Ai好记进行视频转文字整理以下为精炼整理后的会议笔记内容。当大模型遇上医疗一场确定性与非确定性的博弈医疗 AI 有个天然矛盾——医疗要求绝对的确定性但大模型天生就有不确定性。想象一下同一个病人问同一个症状今天和明天得到的回答如果不一样这在医疗场景里是不可接受的。更别说诊断出错可能带来的严重后果。郭春晓在分享中开门见山列出了医疗 AI 面临的五大特有挑战专业性强、容错率极低错误答案可能导致严重后果完整的循证逻辑体系诊断必须依据指南和教科书不能随心所欲大模型非确定性 vs 医疗确定性同一病症多次诊断必须保持一致性大模型长期记忆缺失慢性病诊断需要结合长期病史但对话模型记不住严格的风险合规要求涉及大量隐私数据心理问题等高敏感场景还需要特定干预机制这些挑战决定了直接拿通用大模型做医疗问答是不行的。必须从研发范式本身开始改变。三条研发范式的演进从代码驱动到Agent驱动郭春晓把研发范式的演进分成了三个阶段这个框架其实对其他领域的 AI 应用也有启发传统业务研发范式代码驱动需求→设计→开发→测试→上线周期以周或月计。适合确定性高的业务场景但迭代太慢完全跟不上 AI 时代的变化速度。搜推研发范式数据驱动一周迭代1-2次通过 A/B Test 驱动优化。研发聚焦特征工程和模型训练适合效果可量化的场景。比传统范式快但还不够。Agent研发范式Benchmark驱动这是蚂蚁阿福选择的路径核心特征有三个以天为单位的迭代效率——比搜推又快了数倍Benchmark 作为核心牵引——初期没有评测集走了不少弯路后来意识到评测集才是北极星从代码实现到 Prompt/RAG/模型切换——研发模式从根本上变了核心工作不再是写代码而是调 prompt、换模型、加 RAG郭春晓特别强调了一个概念叫**“代码数据化”**——把过去写在代码里的规则变成可配置的数据资产。这个转变听起来简单但影响深远。支撑Agent范式的分层架构蚂蚁阿福的架构设计很有层次感可以分成四层来看底层数据层医疗指南、权威网页、医生医院等业务数据再加上 post-train 数据。数据质量在这里是生命线。模型与Agent层自研模型 Agentic model配合 Agent 环境Agent Env和工具环境Tool Env。应用层直接面向用户的各种 Agent 应用。治理与运营层模型评测、安全合规、运营监控这是医疗场景下的基础设施。这个架构最值得关注的设计是Agent 环境被抽象成独立的层而不是跟业务逻辑强耦合。这样业务变化时Agent 可以做适配调整而不需要重写整个系统。医疗场景下的检索方案迭代郭春晓专门花了不少篇幅讲检索方案的演进因为在医疗场景下检索质量的差异直接决定了回答的质量。第一步从传统检索到向量检索传统的关键词检索在医疗场景下表现很差——高血压和高血压患者明明密切相关但关键词匹配就是接不上。切换到向量检索后语义匹配能力有了质的提升。第二步从向量检索到知识图谱赋能向量检索只能告诉你这段文本跟查询相关但说不清为什么相关。引入知识图谱后可以建立实体之间的关联关系比如药品和治疗方案之间的因果关系、并发症之间的连锁关系等。第三步多路径检索融合不是简单替代而是把关键词检索、向量检索、图谱检索三条路径的结果做融合。不同的查询用不同的路径——比如查药品说明书关键词检索可能更直接查症状鉴别诊断知识图谱的效果更好。医疗记忆问题的解法慢性病管理是医疗 AI 最难也最需要的场景——病人可能反复咨询同一个病症但每次就诊间隔几个月甚至几年。大模型记不住之前聊过什么这是 Agent 研发范式必须解决的问题。蚂蚁阿福的解法是构建结构化的长期记忆机制把每次对话中的关键信息症状描述、用药记录、医生建议抽成结构化数据存储到独立的记忆库类似 RAG 中的向量库但做了医疗场景的定制化下次对话时自动检索相关记忆拼到上下文中说实话这个方案从技术上并不复杂但落地的难点在于医疗记忆的抽取得格外谨慎。漏掉一条关键病史可能导致完全不同的诊断方向。Agent治理当模型不断迭代如何保证质量郭春晓提到一个非常现实的痛点模型版本更新太频繁了。可能这周测得好好的模型下周新版本就变笨了。蚂蚁阿福的做法是建立完善的评测体系多维度评测集覆盖准确率、一致性、安全性等多个维度自动回归测试每次模型切换或 Prompt 修改后自动跑全量评测Badcase 驱动的快速闭环生产环境中发现的 Badcase走最短路径反馈到评测集和训练数据中这套体系的核心理念是不要让生产环境踩过的坑再踩第二次。每个 Badcase 都应该变成评测集的一部分。对技术团队的启发蚂蚁阿福在医疗 AI 上的实践经验有几点特别值得做垂直领域 AI 的团队参考Agent 研发范式不等于放弃工程规范——正好相反Benchmark 驱动意味着需要更严格的评测体系代码数据化是让 AI 应用适应业务变化的关键——写死的逻辑越多AI 就越难适配长期记忆不是技术问题是数据工程问题——难点在于怎么抽、怎么存、怎么保证质量FAQQ医疗 AI 的错误率要求有多严格A传统医疗场景的错误容忍度接近零。大模型虽然在逐步提升但在涉及诊断建议的场景下目前更多是辅助角色最终决策仍需要医生确认。QAgent 研发范式中代码量真的减少了吗A不是代码量减少了是代码的能力密度提升了。以前几千行业务逻辑做的事情现在可能用一个 Prompt 加几条 RAG 配置就搞定了。但框架代码、评测代码、治理代码的量反而增加了。Q知识图谱和向量检索在实际场景中怎么选A不是二选一是多路融合。知识图谱擅长实体关系和因果推理向量检索擅长语义匹配。医疗场景下两者都需要具体看查询类型来决定权重。以上内容由Ai好记转录整理。Ai好记是一款音视频转图文笔记的AI音视频转录总结工具支持 解析B站、抖音、小宇宙等平台链接及本地/网盘的音视频文件视频转文字后自动生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。