RAG;tokenizer词表和embedding表简述
概述大致了解了transformer中的输入和预测后可以知道embedding表在其中很重要输入的时候抽一次预测的时候也抽一次但embedding表是AI大模型官方训练的一些公司内部的业务流程和文档可能没有训练进去这个时候就需要外部的辅助数据源协助了RAG就是这样一个辅助向量库tokenizer词表和embedding 表大家熟知的是输入内容后会切成token块然后查embedding表转成向量抛给transformerembedding表是提前训练好的在此之前还有一份tokenizer表严格说是先有的tokenizer表再有的embedding表;给AI灌入大量预料训练的时候会依赖BPE算法统计高频字词然后给词条一个编号这里的编号会和后面embedding表的标号对应类似数组下标在tokenizer表训练出来后就会再这个基础上训练embedding表可以理解成tokenizer中1个词条对应embedding中1个向量值编号是一一对应的可以理解成数组下标一致PS:厂商一般会分别提供检索小模型和大模型这里的检索小模型就是用来将问题转成向量的也就是tokenize切块匹配然后到embedding中查询向量这一步做的事RAG chunk切块公司内部的业务资料只需要切成chunk块前面的切tokenizer和embedding向量库都是用的厂商训练好的一般公司自己也没有那么多的语料这里的tokenizer和embedding和AI大模型的tokenizer和embedding并不是同一个是分开训练的;因为两者的关注点不一样AI大模型是为了预测而检索小模型是为了捞出相似的值;chunk对应的向量和检索模型的版本是匹配的因为要计算向量的夹角那么chunk的向量和检索模型提纯后的问题向量需要是关联的所以通常在选定检索模型后会用它先计算chunk块的向量然后再入库chunk块计算出来的向量和问题经过检索小模型的transformer得出的问题向量都是一个长度为1024的向量数组但chunk切块是应用程序提前切好的切分方式有这几种