公司动态

Embedding嵌入技术研究

📅 2026/8/31 6:02:47
Embedding嵌入技术研究
01 Embedding概念Embedding在技术领域通常翻译为 嵌入指将数据如文本、图像转换为固定维度的向量表示以便计算机处理。把离散的高维数据如单词、图片映射到低维连续向量空间语义相似的内容在向量空间中距离更近。02 Embedding是怎么工作的‌1.核心原理‌把离散的高维数据如单词、图片映射到低维连续向量空间语义相似的内容在向量空间中距离更近 。例如发动机异响怎么办和汽车启动后有奇怪声音怎么处理两句话文字不同但意思接近Embedding会让它们的向量也接近。计算机通过计算向量之间的余弦相似度来判断内容是否相似。‌‌‌‌2.技术流程‌输入文本经过分词、查表得到 token 向量再通过 Transformer 等神经网络结构融合上下文信息最后通过池化得到整句话的向量表示 。词元嵌入每个单词对应一个初始向量。位置嵌入添加位置信息让模型知道单词在句子中的顺序。池化输出将多个token向量合并为一个整体语义向量。‌‌‌‌3.与大型语言模型的区别‌Embedding 模型输出一个固定长度的向量用于搜索匹配而大语言模型输出的是下一个词或完整回答。03 主流Embedding模型有哪些‌1.传统词向量模型‌Word2Vec、GloVe、FastText 等每个词有固定向量不考虑上下文 。Word2Vec 有两种结构CBOW根据上下文预测词和 Skip-gram根据词预测上下文。‌‌‌‌2.上下文相关模型‌BERT、Sentence-BERT 等同一个词在不同句子里向量不同能更好捕捉语义 。BERT 的词向量空间存在各向异性问题高频词靠近原点可能影响相似度计算准确性。‌‌‌‌3.最新商用模型‌截至 2026 年 7 月OpenAI 推出 text-embedding-3-small 和 text-embedding-3-large 模型向量维度分别为 1536 和 3072支持多语言且成本更低 。可通过参数调整向量维度在不损失语义表达能力的前提下减少存储空间。‌‌‌‌4.跨模态模型‌CLIP 等模型可同时处理文本和图像让文字狗和图片狗在同一向量空间中靠近 。‌‌‌04 Embedding 用在哪里‌1.语义搜索‌传统搜索看关键词匹配Embedding 搜索能理解语义即使没有相同关键词也能找到相关内容 。例如用户问发动机有奇怪声音能搜到汽车启动后出现异响的常见原因这类文章。‌‌‌‌2.推荐系统‌将用户和物品转换为向量通过计算相似度推荐相关内容如看了《复联 4》推荐《钢铁侠》。‌‌‌‌3.知识库检索RAG‌把文档切成片段并生成向量存入数据库用户提问时先找最相似的片段再交给大语言模型组织回答 。Embedding模型负责找到语义最相关的资料。大语言模型负责阅读资料并生成自然语言回答。‌‌‌‌4.其他应用‌文本聚类、异常检测、分类任务、图文检索等。05 表示学习 vs 嵌入06 表示学习: 让计算机更好地理解世界07 Embedding分类表示学习的一种形式08 嵌入Embedding的价值09 Word Embedding 词嵌入10 Image Embedding 图像嵌入11 Word Embedding vs Language Model 对比12 核心概念-维恩图13 OpenAI EmbeddingOpenAI过去使用text-embedding-ada-002模型最新模型是text-embedding-3-small 和 text-embedding-3-large模型向量维度分别为1536和 3072。14 其他嵌入模型大全实际项目中使用过词嵌入Embedding模型有Qwen3-Embedding-0.6B、BAAI/bge-large-zh-v1.5bge-large-zh-v1.5稳定性更高一些0.6B的模型容易挂掉。15 嵌入与向量数据库不分家-向量数据库选型16 代码截图