公司动态
AI术语手册终极版:覆盖LLM/多模态/Agent/AI Infra 4大领域,附术语演化时间轴
更多请点击 https://kaifayun.com第一章AI术语手册导论人工智能正以前所未有的速度融入开发实践、产品设计与科研探索。然而术语的歧义性常成为跨角色协作的隐性障碍——同一词汇在算法工程师、产品经理与业务方语境中可能指向截然不同的技术内涵。本手册旨在构建统一、精准、可执行的术语认知基线聚焦高频使用、易被误用或存在多义性的核心概念而非泛泛而谈的百科式罗列。 术语理解需与实践锚定。例如“模型”一词在部署阶段常指序列化文件如 PyTorch 的.pt或 TensorFlow 的.savedmodel而在训练流程中则代表参数架构优化器状态的组合体。这种语义漂移直接影响调试路径与错误归因。为强化实感我们提供可立即验证的检查方式验证 PyTorch 模型是否已加载权重# 检查模型参数是否非空 for name, param in model.named_parameters(): if param.data.numel() 0: print(fWarning: {name} has zero elements)识别 ONNX 模型输入签名# 使用 onnxruntime 探查输入信息 import onnxruntime as ort sess ort.InferenceSession(model.onnx) for input_meta in sess.get_inputs(): print(fInput: {input_meta.name}, shape: {input_meta.shape}, type: {input_meta.type})下表对比三类常见术语在学术论文、工程文档与运维日志中的典型用法差异术语学术论文语境工程文档语境运维日志语境Latency端到端推理延迟均值含预处理P95 推理耗时不含网络传输HTTP 200 响应时间含反向代理开销Fine-tuning全参数微调或适配器注入LoRA 权重热加载 PEFT 配置切换ft_job_statuscompleted 日志字段术语不是静态定义而是动态契约。每一次代码提交、每一次 API 设计、每一次 SLO 对齐都在重写它的边界。本手册将始终以可运行的代码片段、可观测的日志模式与可验证的配置结构为锚点确保每个术语都生长于真实系统土壤之中。第二章大语言模型LLM核心术语体系2.1 预训练、微调与推理从理论范式到部署实践三阶段范式演进预训练构建通用表征微调适配下游任务推理实现低延迟服务——三者构成LLM落地闭环。典型训练流程对比阶段数据规模硬件需求典型时长预训练TB级文本数百A100数周LoRA微调千条标注样本1–2 A100小时级推理时动态批处理示例# 使用vLLM进行PagedAttention推理 from vllm import LLM, SamplingParams llm LLM(modelmeta-llama/Llama-3-8b, gpu_memory_utilization0.9) sampling_params SamplingParams(temperature0.7, max_tokens128) outputs llm.generate([Hello,, Explain quantum computing], sampling_params)该代码启用vLLM的内存分页机制gpu_memory_utilization控制显存预留比例max_tokens限制生成长度避免OOM并提升吞吐。2.2 上下文窗口与位置编码架构设计原理与长文本工程挑战上下文窗口的物理约束Transformer 的自注意力机制复杂度为O(n²)当序列长度n超过 32k 时GPU 显存与计算延迟急剧上升。主流模型通过分块chunking与滑动窗口sliding window缓解压力。RoPE 编码实现片段# RoPE: Rotary Position Embedding def apply_rope(q, k, theta10000.0): seq_len, dim q.shape[-2], q.shape[-1] positions torch.arange(seq_len, deviceq.device).float() freqs torch.outer(positions, 1 / (theta ** (torch.arange(0, dim, 2) / dim))) cos, sin torch.cos(freqs), torch.sin(freqs) # 将 q/k 拆分为偶奇两组并旋转 q_even, q_odd q[..., ::2], q[..., 1::2] k_even, k_odd k[..., ::2], k[..., 1::2] q_rot torch.cat([q_even * cos - q_odd * sin, q_even * sin q_odd * cos], dim-1) return q_rot, k该实现将绝对位置映射为相对旋转矩阵使模型隐式学习位置偏移关系theta控制频率衰减尺度值越小则低频分量越显著利于建模长程依赖。主流位置编码方案对比方案外推能力内存开销训练稳定性绝对位置嵌入差高需预分配优ALiBi优极低中RoPE优中优2.3 指令微调与RLHF对齐目标的建模逻辑与人类反馈闭环实现指令微调从监督学习到任务泛化指令微调通过构造多样化的instruction, input, output三元组将模型行为约束在人类可理解的任务语义空间内。其核心是提升零样本迁移能力而非单纯拟合训练分布。RLHF闭环中的奖励建模阶段输入输出偏好标注模型生成的多候选响应对人工排序标签如 A ≻ B奖励训练响应对 标签标量奖励函数 rθ(y)PPO优化策略πφ rθ对齐人类偏好的策略更新典型PPO损失项分解# 简化版PPO clip loss含KL约束 loss -torch.min( ratio * advantages, torch.clamp(ratio, 1-eps, 1eps) * advantages ) beta * kl_div(old_logprobs, new_logprobs)ratio新旧策略概率比控制更新步长advantages基于奖励模型的时序差分估计beta * kl_div防止策略偏离初始模型过远保障稳定性。2.4 MoE架构与稀疏激活模型扩展性理论与GPU显存优化实践稀疏激活的核心机制MoEMixture of Experts通过门控网络Gating Network动态选择Top-k专家参与前向计算实现“稀疏激活”。仅约10%–20%的参数被实际调用显著降低显存带宽压力。显存占用对比以16B参数模型为例架构激活参数量峰值显存FP16稠密Transformer100%~32 GBMoEk2~12.5%~8.5 GBPyTorch中Top-k路由实现片段logits gate(x) # [B, num_experts] _, top_k_indices torch.topk(logits, k2, dim-1) # 返回top-2索引 # 构造one-hot mask仅激活对应专家 mask F.one_hot(top_k_indices, num_experts).sum(dim1).bool() # [B, num_experts]该逻辑确保每个token仅路由至2个专家topk的k值直接影响计算密度与负载均衡one_hot sum生成稀疏掩码为后续专家并行计算提供布尔调度依据。2.5 Tokenization机制与词表演化从Byte-Pair Encoding到动态分词工程落地BPE核心思想与迭代构建示例BPE通过贪心合并高频字节对逐步扩展词表初始以字符为单位反复统计并合并出现频次最高的相邻符号对# 示例BPE合并步骤简化版 tokens [l, o, w, _, l, o, w, e, r] pairs [(l,o), (o,w), (w,_), (_,l), (l,o), (o,w), (w,e), (e,r)] # 统计后发现(l,o)频次最高 → 合并为lo tokens [lo, w, _, lo, w, e, r] # 下一轮输入该过程体现“数据驱动词边界”的本质无需预设语言规则仅依赖语料统计分布。工业级动态分词适配策略真实场景需兼顾效率、内存与领域迁移能力支持在线热更新子词表如增量BPE或SentencePiece的unigram模式按请求上下文动态选择分词器中英混排时自动切换分词逻辑主流分词器性能对比分词器训练开销推理延迟OOV率中文新闻BPE高低3.2%SentencePiece (Unigram)中中1.8%HuggingFace Tokenizers低预编译极低2.1%第三章多模态AI基础术语解析3.1 跨模态对齐与联合嵌入表征学习理论与CLIP/ViLT实战对比对齐目标的本质差异CLIP 采用全局对比学习最大化图像-文本对的余弦相似度ViLT 则在 Transformer 中间层引入细粒度 token-level 对齐支持区域-短语匹配。联合嵌入实现方式# CLIP 的双塔结构前向逻辑 image_emb image_encoder(images) # [B, 512] text_emb text_encoder(tokens) # [B, 512] logits image_emb text_emb.T * temp # 对称对比 logits该设计依赖大规模配对数据驱动隐式对齐temperature 参数控制 logits 分布锐度典型值为 0.07。模型架构关键对比维度CLIPViLT编码器结构独立双塔ResNet/ViT RoBERTa单塔共享 Transformer对齐粒度全局向量级token patch 级3.2 视觉-语言生成范式从BLIP到Flamingo的架构演进与推理延迟优化双流协同架构的演进路径BLIP采用独立编码器交叉注意力融合而Flamingo引入可插拔的Perceiver Resampler将高维视觉特征压缩为固定长度的token序列显著降低跨模态对齐开销。关键延迟优化策略视觉token下采样将ViT输出从256→64 token减少Transformer KV缓存压力冻结视觉主干仅微调Resampler与LM适配层避免全参数重计算推理时延对比单卡A100batch1模型视觉编码耗时(ms)跨模态生成延迟(ms)BLIP-2187421Flamingo-9B132298Perceiver Resampler核心逻辑# Flamingo中Resampler的简化实现 class PerceiverResampler(nn.Module): def __init__(self, num_queries64, dim1408, heads16): super().__init__() self.latents nn.Parameter(torch.randn(num_queries, dim)) # 可学习query self.cross_attn nn.MultiheadAttention(dim, heads, batch_firstTrue) # 注意不更新ViT权重仅传播梯度至latents和attn权重该模块通过固定数量可学习latent query与视觉特征做cross-attention规避了原始图像patch序列长度带来的二次复杂度是延迟下降的核心设计。3.3 多模态评估基准从MME到MMStar——评测维度设计与真实场景偏差分析评测维度演进路径MME侧重基础感知能力OCR、计数、颜色识别而MMStar引入任务链推理、跨模态时序对齐与开放域知识调用更贴近真实交互场景。典型偏差现象图文对齐数据过拟合模型在合成图像上得分高但在手机拍摄模糊图像上性能骤降指令分布偏移基准中92%为“描述类”问题但真实应用中67%为“操作引导类”如“帮我在这张截图里圈出付款按钮”MMStar评估协议关键字段{ task_type: multi-step_vqa, // 支持多跳推理 image_quality: real_world, // 标注图像采集环境非合成 temporal_span: 3, // 视频帧间最大时间间隔秒 domain_tag: [e-commerce, healthcare] // 场景约束标签 }该结构强制模型声明其适用边界避免泛化能力误判temporal_span参数直接约束视频理解的时间鲁棒性domain_tag支持按垂直领域切片评估。第四章AI Agent与智能体系统术语框架4.1 Agent三要素感知-规划-执行认知架构理论与LangChain/MS AutoGen实现对照感知环境输入与状态建模LangChain 中的Tool与 AutoGen 的ConversableAgent均通过observe()方法封装外部数据源。例如class WeatherTool(BaseTool): def _run(self, location: str) - str: # 调用API获取实时天气模拟“感知”过程 return fWeather in {location}: Sunny, 26°C该方法将原始观测如API响应结构化为语义化文本供后续规划模块消费location为关键上下文参数决定感知范围。规划与执行的协同机制框架规划实现执行调度LangChainLLMChain PromptTemplateAgentExecutor.run()AutoGenGroupChatManager 决策路由agent.send() 异步消息传递核心抽象对比感知层统一抽象为Observation Interface输入标准化规划层体现为Reasoning Loop含反思、工具选择、步骤分解执行层依赖Action Dispatcher同步/异步、失败重试、结果归一化4.2 工具调用与函数抽象OpenAPI集成范式与动态工具注册运行时实践OpenAPI驱动的工具契约定义通过 OpenAPI 3.0 规范统一描述外部服务能力实现工具元数据的可发现、可验证、可编排paths: /v1/translate: post: operationId: translateText parameters: [{name: target_lang, in: query, schema: {type: string}}] requestBody: content: application/json: schema: type: object properties: text: {type: string}该 YAML 片段声明了翻译工具的输入契约operationId 作为运行时唯一标识符parameters 与 requestBody 共同构成函数签名供 LLM 解析调用意图。动态工具注册运行时启动时扫描 OpenAPI 文档并生成工具注册表按需加载 HTTP 客户端适配器如 Go 的http.Client支持热重载监听文件变更并重建工具索引工具执行上下文隔离字段类型说明tool_idstring对应 OpenAPI 中的 operationIdtimeout_msint单次调用超时阈值毫秒rate_limitint每分钟最大调用次数4.3 记忆机制分类学向量记忆、摘要记忆与长期存储的工程权衡三类记忆的定位与取舍向量记忆强调低延迟相似性检索适合实时上下文增强摘要记忆压缩语义信息降低存储开销但牺牲细节保真度长期存储则聚焦持久化与事务一致性引入ACID约束。典型实现对比维度向量记忆摘要记忆长期存储写入延迟10ms50–200ms500ms查询精度高余弦相似度中关键词/主题匹配精确SQL/B树混合架构中的协同逻辑// 向量缓存命中失败时触发摘要回溯 if !vectorCache.Get(ctx, queryVec) { summary : summaryDB.QueryByTopic(ctx, extractTopic(query)) if summary ! nil { longTermID : summary.SourceRef // 关联长期存储原始记录 fullRecord : persistentStore.Get(ctx, longTermID) } }该逻辑体现分层降级策略向量层负责快速粗筛摘要层提供语义桥接长期存储保障数据完整性与可审计性。参数SourceRef为跨层索引键需在写入时统一生成并维护一致性。4.4 多Agent协作协议Debate、Role-play与协商机制在AutoGen/CrewAI中的落地差异Debate 协议实现对比AutoGen 通过 GroupChat DebateSpeakerSelector 实现多轮观点对抗而 CrewAI 依赖 Task 依赖链与 callback 手动触发质疑流程。Role-play 协议差异AutoGen角色由 LLMConfig 和 system_message 显式绑定支持动态角色切换CrewAI角色固化于 Agent 实例需通过 allow_delegationTrue 启用跨角色调用协商机制核心差异维度AutoGenCrewAI终止条件基于 max_round 或 speaker_selection_method依赖 Task.output_pydantic 验证或人工 callback# AutoGen 中 Debate 的典型配置 groupchat GroupChat( agents[critic, analyst, planner], messages[], max_round12, speaker_selection_methodround_robin # 或 auto 触发辩论逻辑 )该配置启用轮询式发言权调度max_round12 防止无限循环speaker_selection_methodauto 则结合 LLM 输出自动选择最适发言人实现轻量级协商闭环。第五章AI基础设施AI Infra术语全景图AI基础设施并非单一组件而是由计算、存储、网络、调度与可观测性五大支柱构成的协同系统。在实际部署中企业常因术语混淆导致架构选型偏差——例如将“模型服务”Model Serving误等同于“推理引擎”Inference Engine而忽略了其依赖的底层资源编排能力。核心组件分类Compute Abstraction如 NVIDIA Triton 推理服务器支持多框架模型并行加载需显式配置instance_group参数以绑定 GPU 设备拓扑Data Plane AccelerationRDMA over Converged EthernetRoCE v2在千卡集群中降低 AllReduce 延迟达 37%Orchestration PrimitivesKubernetes Custom Resource DefinitionsCRDs如PyTorchJob或TFJob封装分布式训练生命周期典型部署代码片段# Kubeflow Manifest: Multi-GPU Training Job apiVersion: kubeflow.org/v1 kind: PyTorchJob spec: pytorchReplicaSpecs: Master: replicas: 1 template: spec: containers: - name: pytorch image: nvcr.io/nvidia/pytorch:23.07-py3 resources: limits: nvidia.com/gpu: 4 # 绑定4块A100术语对齐对照表厂商术语标准定义对应开源实现AWS SageMaker Training CompilerGraph-level IR 优化器TVM RelayGoogle Vertex AI Hyperparameter TuningBayesian Optimization ControllerKatib可观测性关键指标GPU Utilization → NVML API 采集间隔 ≤ 1sTensorRT Engine Load Latency → Prometheus histogram_buckets: [0.1, 0.5, 1.0, 2.5]msNCCL AllReduce Bandwidth → 每节点暴露 /metrics 端点单位 MB/s。