公司动态
AI在教培场景的应用:多模态融合的思考,从陪练产品看AI工程落地
本文源自 QCon 北京 2026 重磅分享《AI在教培场景的应用——多模态融合的思考》。我们用 Ai好记 对演讲内容进行了深度提炼与重构形成这篇兼具技术深度与商业洞察的行业指南。它不仅是一份会议笔记更是一份为 AI 产品经理、技术负责人和创业者准备的「落地避坑手册」。这场分享来自一位有金融工程背景、从量化到互联网大厂再到银行科技子公司的工程师。他选了一个「非金融场景」来切入原因是教培领域里藏着一个 AI 技术难点高度集中的案例能更好地提炼出 AI 工程化落地的共性难题。核心洞察大模型正在重新定义软件而软件工程也在反向规划大模型的落地边界。本文深度拆解了 AI 课程生成与智能陪练两大核心场景揭示了多模态融合、语音技术突破、Agent 协同与工程化约束背后的完整产品逻辑与实战路径。陪练型任务教培场景里最典型的 AI 应用1、金融机构的培训刚需先交代业务背景。金融机构对从业人员有持续培训的需求尤其是在降本增效的大前提下传统「讲师带教 线下演练」的模式成本高、效率低。具体的应用场景是银行客户经理和远程销售的培训AI 要能分析金融产品特点并完成多模态的仿真对练。2、陪练和投顾是两个不同的东西这里有个容易混淆的关键点。投顾是「教练模式」AI 以专家身份指导你怎么做而陪练是「客户模式」AI 扮演客户让学员在对练中练习话术、应对异议。对培训逻辑来说陪练反而是更贴近实战、更能练出真本事的形态。3、产品延伸与备课场景除了金融客户经理这套能力还能往外走。一个是生成培训材料把教学沉淀成结构化课件另一个是扩展到学校应用切入更广的教育场景。这背后的产品主线是「AI 场景创建 多模态对练 内容生成」的组合。产品价值延伸这套场景创建对练生成的组合拳实际上构建了一个可复用的 AI 教培中台架构。它不仅服务于金融培训更能快速复制到企业内训、技能考核、语言学习等广阔领域展现了强大的产品扩展性和商业化潜力。## 产品落地的四大痛点也是 AI 工程的核心难点尹辰轩把这款陪练产品踩过的坑归纳为四大痛点。这四点几乎是所有做 AI 学习类产品的团队都会撞上的。第一个痛点交互体验问题多模态价值被低估一方面要超越 Chatbot 那种纯文字交流多模态的价值经常被低估。他从 OpenAI 和 Harness 的路径里得到启发认为多模态是解决「最后一公里」体验的关键。另一方面是语音层面的体验传统用文本型数据训练出来的语音交互始终差口气他在思考能不能直接用声波语音波形来做训练。第二个痛点场景覆盖有限创建流程太长陪练产品的场景创建流程非常长要收集剧本、设定背景一套金融机构的场景往往要耗时两到三周。团队的诉求很简单能不能一句话或上传一个文档几分钟内就创建一个场景。这是效率层面的硬需求。第三个痛点专业度问题通用大模型不够用为什么不直接用豆包或 Kimi 这种现成大模型他用代码生成来类比通用模型在专业场景里输出质量不稳定需要「聪明但克制」。大模型必须被规制靠工程化来保证专业能力而不是指望模型自己懂行。第四个痛点toB 商业化能力价值要脱离聊天从第一性原理出发AI 必须直接产生业务价值而不是停留在聊天对话层面。只有多种形式地与现实世界互动才能决定商业价值这一点同时适用于 toB 和 toC 业务。商业化启示这四大痛点清晰地指出AI 产品的价值必须超越对话本身深度嵌入业务流解决效率、体验、专业度和规模化四大难题才能实现可持续的 toB/toC 商业化。## AI 课程产品的建设路径从大纲到成片1、生产效率提升的瓶颈方向明确后第一个现实问题是生产效率。他发现「一句话生成」的可用性不超过 60%需要反复沟通和调校。AI 生成课程不是一句话的事得拆解成一道道工程工序。2、课程大纲设计课程内容往往来自几十万、上百万字的大部头教材。他的做法是分层和长文本管理用工程化手段降低模型处理难度。一道很实用的思路是让模型先读提纲、前言、摘要、引言而不是糊里糊涂地把整本书塞进去。这既省了训练性价比又让生成更精准。3、课程内容生成内容生成采用分章节、分段落、分模块的粒度每一块独立负责。配合多模态插件接入文生图、文生视频、AI 动画这些能力既可以挂进主流程也可以作为独立环节。4、排版过程不做映射式工程这里有个重要的技术取舍。早期的思路是「PPT 逻辑」把内容分类映射到工程化 PPT 模板但他明确不推荐这种映射式工程认为这不是 AI 工程未来的方向。更好的做法是模拟人的行为过程也就是「基于坐标定位的排版」先收集素材、做排版思考最终输出坐标。通过训练一个大模型输出漂亮的坐标让排版真正智能起来。5、专训排版大模型顺着这个思路他们还专门训练了排版模型。数据准备阶段收集大量好看的 PPT解析重要参数把内容原子化拆分关联图片并建立关系甚至记录动态动画或先后顺序。让模型模仿人的排版过程输入排版要素输出坐标坐标用四维表示左上角距离加长和宽。最后工程化渲染到画布用户调试后导出这样就解决了传统模板排版不灵活的问题真正实现了 PPT 应用的智能落地。6、语音合成与视频集成内容生成后用 TTS 语音合成做配音配合语速调整等处理再引入数字人合成视频把语音和数字人集成最终形成完整的 AI 课程产品。从技术到产品这条路径清晰地展示了如何将前沿的 AI 技术大模型、多模态、TTS、数字人串联成一个端到端的、可交付的标准化产品。其核心在于用工程化思维拆解创意生成过程将不确定性转化为可控的生产流水线。## 陪练流程路径从真实对练到多模态逼真1、训练场景与剧本大纲陪练需要先定义训练场景和剧本大纲。这里有个很实用的权衡大纲越宽泛越有人性化越具体越可控。他举了保险推销的例子当引导过程跟产品重点无关时宽泛的大纲反而能带来更自然、更真实的对话练习这也是 AI 陪练产品的核心优势。2、Agent 驱动对练解决记忆错乱AI 陪练绕不开一个问题角色扮演中的记忆错乱。AI 经常忘记自己是「客户」甚至出现身份调换。他的解法是用 Agent 驱动 AI 对练通过工程化手段约束 AI 的行为边界而不是指望模型自己记住。3、ASR LLM TTS 的传统方案与其极限传统的语音方案是「ASR 语音转文本 → LLM 文本问答 → TTS 文本转语音」这是一条「齿轮式」的技术发展路径。走到极致优化的表现是蒸馏后的问答速度极快甚至比豆包、Timi、千问还快流式输出按句子断句合成达到毫秒级延迟。但它有个致命问题无法打断。因为 ASR 需要确认语句结束才能触发回答停留阈值通常设在 1.1 到 1.5 秒导致端到端延迟 1 秒以上。机器人打电话那种 1 到 2 秒的不自然停顿就是典型表现体验很僵硬。Speech2Speech 的路径优势他因此重点介绍了 Speech2Speech 的路径优势逐字理解与实现。类比大语言模型预测 token 概率的原理这种方案在「语言空间与坐标定位」上做了深入思考能大幅降低延迟。声波空间训练绕过文本这条弯路这是整场分享里最有启发性的技术观点。他质疑了「先转文本再理解」的合理性用英语交流的思维过程来类比英语→汉语→理解→回答→英语中间多一道翻译导致延迟和词不达意。而母语交流是直接理解无需文字转化。同理大模型完全可以建立「声音特征向量」声音组合本身就蕴含信息与规律信息量不亚于文本。他提出搭建一套新的训练体系跳过文本训练过程直接在声波层面做多模态扩展视觉内容训练、形状与局部推断也是同一思路。多 Agent 协同从单点能力到系统工程单 Agent 与多 Agent单 Agent 只能解决单点问题多 Agent 才能解决全面性问题。关键是多 Agent 需要分工和交叉验证。尤其在 toB 场景容错率要求极低金融业务的一个错误可能就是巨大损失。复杂任务规划与协同引擎复杂任务往往包含能力重复、循环、选择性调用需要一个协同引擎来做规划。他提到一个很有意思的思路用 MD 文件进行协同规划这也是多 Agent 协同的底层逻辑。多数字人的设置思考他引申到一个有趣的哲学问题为什么是三个数字人而不是一个因为「绝对聪明」和「绝对自制」是矛盾的限制不能内化于训练之中。他用培养聪明小孩来类比语料不干净会导致推理极端化越聪明的模型越可能出现幻觉、篡改内容等风险。所以多 Agent 的相互制衡本身就是一种工程化的安全设计。工程化约束AI 时代的「社会规范」为什么必须靠工程化AI 的「聪明」能力无法内化或削减所以只能靠工程化来约束这就像人类社会靠法律、道德、管理条例来维持秩序。他提出要对大模型分类与引导不同「聪明材质」匹配不同应用。比如警察角色有警察的行为准则理财分析师有行规和职业道德。工程化的作用就是确保 AI 按约束的路线使用。AI 工程工作不会消失反而更重要核心判断是AI 工程岗位不会消失反而越来越重要。因为要「稳妥地应用聪明材质」并实现商业化价值落地必须依赖工程化。绝对聪明很难做到绝对稳定只能按人类意志稳定执行否则在特殊场景下可能跳脱没有工程化的落地就是灾难。上下文记忆短期 记忆卡片关于记忆他明确不训练超长记忆大模型因为成本不值得。他类比人类的非线性记忆方式你不会线性地去回忆上周五在干嘛提出长期记忆是碎片式、截面式的。具体机制就是「记忆卡片」把信息压缩成记忆卡片问答时用短期记忆过去几轮加上记忆卡片来回答。这样就解决了陪练里最容易出的角色互换问题AI 只需要一张简单的记忆卡片输入不用翻长长的历史链高效又低成本。关键技术取舍小结把这场分享的工程取舍浓缩成几句话。生成方面不要迷信一句话生成要做分章节、分模块工程化排版方面不要映射式模板要训练模型输出坐标语音方面不要死守ASRLLMTTS要探索声波直训和 Speech2Speech协同方面单 Agent 不够要多 Agent交叉验证约束方面聪明无法内化靠工程化用人物设定 记忆卡片管住角色。这些思路对任何从事 AI 学习或交互产品开发的团队都有直接的参考价值。常见问题FAQQMultimodal 融合在教培 AI 里到底解决了什么解决的是「最后一公里」的体验问题。从纯文字 Chatbot 进化到语音、画面、数字人融合的仿真对练让学员获得接近真实的互动体验也突破了语音层面文本训练的局限。Q为什么不用豆包、Kimi 这类现成通用大模型通用大模型在专业场景输出不稳定属于「聪明但不够克制」。必须通过工程化规制比如场景剧本、人物设定、记忆卡片、Agent 约束来保证专业能力的稳定输出。QAI 生成课程和直接一句话生成的区别在哪一句话生成的可用性不超过 60%无法直接商用。真正落地要拆成分章节、分模块生成配合排版模型输出坐标、TTS 配音和数字人集成形成完整的工程链。QASRLLMTTS 方案为什么体验不好因为 ASR 需要确认语句结束才能回答停顿阈值 1.1 到 1.5 秒端到端延迟 1 秒以上导致对话僵硬、无法打断。Speech2Speech 是更优的演进方向。Q多 Agent 协同和单 Agent 有什么本质区别单 Agent 只能解决单点问题多 Agent 通过分工和交叉验证解决全面性问题尤其能满足 toB 场景的低容错率要求还能通过多 Agent 相互制衡降低「绝对聪明」带来的风险。QAI 的记忆是怎么做的需要训练超长记忆模型吗不需要成本不值得。采用「短期记忆 记忆卡片」机制把关键信息压缩成记忆卡片问答时叠加使用既高效又低成本还能解决角色扮演中的记忆错乱。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。