公司动态
【必学】上下文工程2.0:从零构建AI理解力,大模型应用开发进阶之路
前言2025年6月Shopify CEO Tobi Lütke 和 AI 大神 Andrej Karpathy 在 X 上提出了一个新概念——上下文工程。Karpathy 将其定义为一门微妙的艺术与科学旨在填入恰到好处的信息为下一步推理做准备。然而这个新概念与提示词工程有什么不同为什么它会和 RAG、MCP 等技术扯上关系过往的回答大多从技术角度出发试图拆解上下文都包括什么如何让它能够发挥最好的效果。10月30日上海交通大学和 GAIR 实验室发表了论文《上下文工程 2.0上下文工程的上下文》用一种更全面的视角定义了这个新兴学科。它不再把人机交互视为技巧而是回归到了交流动力学的基础逻辑。本文将以这篇论文为基础系统性地回答三个核心问题上下文工程到底是什么它的基础构件是什么未来会如何发展01上下文工程是什么一门关于熵减的古老学科要理解上下文工程必须先回答为什么人与机器的交流如此困难论文认为这是因为人类与机器之间存在一道认知鸿沟。人类的交流是高熵的他们的表达无序、混乱、充满隐含信息。当我对同事说帮我搞定那个报告他需要记忆中的那个报告指什么、从我的语气判断紧急程度、理解辛苦背后的社交暗示。这些都是海量的、模糊的、非结构化的上下文。而机器是低熵生物它无法接受足够多的上下文只能理解明确的、毫不含糊的指令。为了弥合这道鸿沟人类必须将高熵意图转化为机器可理解的低熵指令。其手段就是建立更丰富有效的上下文。正如马克思所说人的本质是社会关系的总和。想要让AI更理解我们就得让它理解人身处的一切情景。这就是上下文工程的本质通过更好的上下文达成系统性的熵减过程。在这个系统中最重要的是实体即人、应用、环境。上下文就是描述实体状态的所有信息 。上下文工程则是设计和优化上下文的收集、管理、使用 以提升机器理解和任务表现的努力。从这个意义上讲上下文工程根本不是新概念。在AI之前它已经发展了20多年而现在我们已经在上下文工程 2.0 时代了。1.0时代 (1990s-2020)上下文即翻译从计算机出现后我们就开始探索人机理解的逻辑。操作系统的UI就是最古老、最成功的上下文工程实践。**在那个时代上下文工程的核心是翻译即把人的自然语言意图翻译成机器可理解的语言。**工程师通过设计图形界面GUI用鼠标操作和结构化界面将高熵意图工程化为低熵交互流程。编程语言也是如此它把自然语言框架化成规范指令。但这个过程其实很违反人类的自然表达天性。比如学编程你不光要学语言还要学习一种规范化的思维。2.0 时代 (2020-至今)上下文即指令2020年随着 GPT-3 发布我们迎来了一个全新时代。用户可以直接用自然语言和机器对话。翻译的中间层消失了设计师和程序员的熵减工作也随之消失。但普通用户发现虽然和 AI 说话不需要翻译了它依然理解不了话语背后的信息。熵减的需求并没有消失只是转移到了用户身上。他们必须学会精确表达意图、构建有效 prompt、调试输出。这就是提示词工程爆发的原因人们在试图重新发明一种结构化的自然语言来减少沟通中的障碍。但除了规范自己的表达我们也可以从模型本身下手给它提供更好的脚手架和系统让它更好地理解我们的意图。这就是上下文工程诞生的背景。02AI与人沟通为什么还是有理解差距既然上下文工程是为了解决目前人与AI沟通的Gap那它做不到和我们人类一样可以高熵交流的核心原因都有什么呢论文通过与人类沟通做对比总结了八大AI的缺陷我们可以把它归结成四种。正是因为这些缺陷存在它理解不了我们的高熵交流造成了Gap。**首先AI的感官是残缺的。**人类沟通时会接收大量文字外信息而 AI 只能获得用户明确的输入。它看不见我们所处的环境上下文收集存在先天缺陷。第二是AI的理解能力有限。与人类相比AI理解和整合上下文的能力很有限。就算它感官不残缺即使把所有信息都喂给 AI它也不一定理解其中关系。当前模型难以处理复杂逻辑和图像中的关系信息。**第三个最要命就是记忆的缺失。Transformer 架构存在长上下文性能瓶颈导致模型既没有长期记忆系统也难以捕捉长距离依赖关系。**AI记不住过去的对话就不可能像人一样建立背景共识。正是这些我们都知道的过去让人类说话如此省力。而当前试图去存储记忆的方法如RAG等仍然效率较低。第四是相对于人来讲AI的注意力是涣散的。这被论文称为“上下文选择困难”。就算我们解决了上一个问题给 AI 外挂了长期记忆比如RAG理论上讲就是可以存储所有内容。但面对海量信息时AI 并不知道该看哪里。针对这些缺点过去提示词工程通过添加前情提要修补记忆缺失通过手动精炼信息、规范化表达减少理解和注意力负担。它就是上一代针对模型缺陷的全面补丁。但这个过程太耗费力气了。因此一个好的上下文工程就是尽可能搭建脚手架让模型借助脚手架解决当下能力不足的问题。让AI真的可以成为人的数字存在Digital Presence人们可通过上下文数字永生让你的对话、决策、交互轨迹可以持续演化。但这个过程太耗费人力。一个好的上下文工程应该搭建脚手架让模型借助系统解决当前能力不足的问题。03上下文工程AI时代的泥瓦匠为了解决模型当前问题论文提出了一个包含收集、管理、使用三个阶段的完整上下文工程体系。这张技术地图详细说明了我们为弥补 LLM 缺陷而必须搭建的庞大脚手架系统。构件一上下文收集与记忆系统这一构件主要修复 AI 的感官残缺与记忆缺失。上下文收集方面我们必须超越简单的文本输入转向多模态、分布式的收集。多模态融合就是将文本、图像、音频通过各自编码器映射到共享向量空间让模型真正理解多模态意涵。而分布式收集则通过智能手机、可穿戴设备、IoT 传感器甚至脑机接口主动捕捉用户无法用文字清楚表达的环境上下文和高熵信息。存储系统则是给记忆搭建脚手架。为了解决 Transformer 带来的记忆缺失我们需要构建分层内存架构让模型形成类人的记忆结构。它类似操作系统的内存管理短期记忆是 AI 的内存即有限的上下文窗口长期记忆是 AI 的硬盘用于持久化存储高重要性上下文的外部数据库。两层之间需要建立类似睡眠的记忆转移机制。系统处理过往内容将重要的短期记忆转存为长期记忆。构件二上下文管理这主要解决AI 理解能力有限难以处理复杂逻辑和关系信息的问题。核心是上下文抽象论文称之为自我烘焙(Self-Baking)。既然 AI 看不懂原始的、高熵的上下文这个脚手架就充当预处理器主动将上下文消化并烘焙成 AI 能理解的低熵结构。这并非简单摘要而是区分记忆存储和学习的关键。没有它智能体只是在回忆有了它智能体才是在积累知识。目前流行实现方法从简单到高级分为三种自然语言摘要让 AI 自己摘要重要信息但它是纯文本缺少结构难以深度推理。模式化提取从原始上下文提取关键事实人、地点、事件按固定模式存入知识图谱。AI 不再需要理解复杂关系只需查询已准备好的结构化关系图。在线蒸馏如 Thinking Machine 提出的方法将上下文渐进式压缩为向量转化成模型自己的知识。构件三上下文使用这个构件主要解决AI 注意力涣散问题规范收集和管理后的上下文如何进行协作和推理。论文提出的解决方法也很直接即构建高效的上下文选择机制先过滤注意力。当前模型在 RAG 中搜索记忆时过于依赖语义相关性向量搜索会搜出大量信息导致上下文过载理解能力大幅下降。因此我们需要一个更高效的搜索机制。它需要满足以下几个特质理解逻辑依赖。让AI使用RAG搜索时用逻辑关系而不是简单地问“什么信息在语义上最像”**平衡新近度与频率。**优先关注“最近使用过”或“经常使用”的信息最终模型能够达到主动需求推断的水平。系统不再被动地等待你提问而是基于上下文对你隐藏目标做分析主动推断你下一步可能需要什么信息并提前为你准备好。至此这个上下文工程框架通过收集、管理、使用上下文弥补了 AI 在感官、“理解”、记忆和注意力上的四大缺陷形成了一整套关于上下文的闭环工作流程。在这个流程下我们可以把提示词工程的重担转移回模型自身让它通过系统尽可能好地理解我们。04上下文 3.0 4.0最好的上下文工程就是没有上下文论文的蓝图并未止步于此。随着基础模型认知能力不断提升我们将迎来熵减努力主体的第二次、乃至第三次转移。上下文工程 3.0 时代将在当机器智能达到人类水平能处理情绪、暗示等复杂上下文模态时到来。这时理解瓶颈将被打破记忆处理将成熟AI 将主动理解我们的场景并与我们协作。但在这个时代长期记忆问题仍未解决模型主动性依然有限。**上下文工程 4.0 时代**则将在机器智能达到超人智能时到来。此时人机交流的熵被彻底消除。你什么都不用说它都能预测你想干什么并执行安排。在这个时代上下文工程消失了。或者用更好的方法讲它所搭建的脚手架最终融入了核心架构。**这在技术发展的历史中几乎是常态。**最典型的案例就是注意力机制本身。这个机制最初是作为编码器-解码器 RNN 的外挂补丁出现的用来解决序列翻译中的瓶颈问题。但到了 2017 年Transformer 架构彻底将注意力机制内化为核心只是移除了RNN部分以实现并行处理。曾经的脚手架变成了今天所有大语言模型的基础架构。同样的故事在上下文工程领域其实也在进行中。2025年3月Sam Altman 宣布将在所有OpenAI产品中添加 MCP 支持包括 ChatGPT 桌面应用。这标志着工具使用这个能力不再是简单的外挂而是正在成为 Agent 架构的固定组成部分。从注意力机制到 MCP我们看到了同一个模式:当某种脚手架被证明足够有效且通用时它就会从外部工具演变为标准协议最终融入模型或 Agent 的核心架构。因此即使我们知道上下文工程有一天会消失但当下它依然是通往 AGI 路上的必经之路。不是因为它能让模型更聪明那是算法和算力的任务。而是因为它能让模型更好用。正如 Transformer 不需要等到模型完全理解语言才出现MCP 也不需要等到模型拥有完美记忆才部署。它们的存在让我们可以用今天的模型实现明天才能达到的应用体验。这些脚手架最终会以某种形式也许是协议、也许是架构、也许是全新的神经网络层融入未来的模型。它们不会消失只会invisible。上下文工程的终极形态就是让自己成为不需要被谈论的基础设施。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】