资讯动态

向量模型分词与截断机制详解:从文本到向量的完整旅程

发布时间:2026/10/2 9:28:28 来源:尧图企业网站定制
向量模型分词与截断机制详解从文本到向量的完整旅程一句话总结文本进入模型前先经分词器切成 token再按窗口大小截断最后编码为固定维度向量。顺序不可颠倒截断默认保前弃后。一、核心流程三步走你的输入文本 ↓ 【Step 1】分词器Tokenizer切分 → 变成 token 序列如 1000 个 token ↓ 【Step 2】窗口截断Truncation → 超过 512保前弃后截成 512 个 ↓ 【Step 3】模型编码Encoding → 通过 Pooling 压成固定维度向量如 768 维关键认知分词 → 截断 → 编码这个顺序不可颠倒。二、Step 1分词器——谁来切、怎么切2.1 分词器是谁分词器是模型配套的工具不是模型本身也不是人工干预。它通常以vocab.txt或tokenizer.json文件形式存在内含几万个预定义的 token。2.2 分词规则从哪来来源说明预训练语料统计高频组合优先成词如中国比中国更常一起出现词典文件训练前就定好的 token 列表算法类型WordPiece、BPE、SentencePiece 等策略不同2.3 同一句话不同分词器结果不同输入BERT-wwmGPT BPE中文优化模型“中国我爱你”[中国, 我, 爱, 你]4个[中, 国, 我, 爱, 你]5个可能[中国我爱你]1个结论分词器是独裁者怎么切它说了算。三、Step 2窗口截断——超长的怎么处理3.1 为什么需要截断Transformer 模型的注意力机制计算复杂度是O(n²)token 越多越慢。因此模型在训练时就设定了最大处理长度窗口大小。3.2 常见窗口大小模型窗口token 数约等于汉字数BERT-base512~300-400 字GPT-3.54096~2000-3000 字GPT-4128K~6-8 万字3.3 截断策略默认保前弃后原始文本1000 token [token_1][token_2]...[token_512][token_513]...[token_1000] ↓ 截断线 送入模型512 token [token_1][token_2]...[token_512] ← 后面 488 个直接消失策略做法适用场景前截断默认保留前 N 个后面全扔开头有主题句、关键词后截断保留后 N 个前面全扔结尾有结论两头截断前后各留一点中间扔掉特殊需求重要模型不会报错静默丢弃对后半截内容毫无感知。四、Step 3编码——为什么维度固定4.1 从变长到定长文本长度千变万化但下游任务相似度计算、聚类、检索需要定长输入。模型通过Pooling池化完成转换输入文本 → Tokenizer 分词 → Transformer 编码 → Pooling 池化 → 固定维度向量 3字 3个token 3×768矩阵 取平均/取CLS 1×768向量 5字 4个token 4×768矩阵 取平均/取CLS 1×768向量 1000字 被截断到512token 512×768矩阵 取平均/取CLS 1×768向量4.2 常见池化策略Mean Pooling对所有 token 向量取算术平均CLS Pooling取特殊标记[CLS]对应的向量BERT 系列Last Token Pooling取最后一个 token 的向量GPT 系列无论中间有多少 token最终都是 1 × hidden_size。五、常见误区澄清误区真相“字数越多向量维度越高”❌ 维度由模型架构固定与输入长度无关“不超过窗口大小就不会被分词”❌ 分词是必做步骤永远发生“先截断再分词”❌ 必须先分词才能知道超没超窗“长文本信息量更大所以向量更丰富”❌ 超窗部分被丢弃信息反而丢失“中文一个字对应向量一维”❌ 模型处理的是 token且经过高维非线性变换六、工程实践建议6.1 中文场景选模型需求推荐模型通用中文语义bge-large-zh-v1.5、gte-large-zh短文本匹配piccolo-base-zh不要用原版 BERT对中文分词弱、语义差6.2 长文本处理策略以RAG 报警知识库为例报警记录 A传送带电机过载温度异常升高...超长 ↓ 方案1Chunking 分块 → 切成多段 512 token分别编码 方案2摘要优先 → 先 LLM 提取关键信息再编码 方案3关键信息前置 → 写记录时结论放开头细节放后面6.3 生产环境注意事项锁定模型版本换模型 换分词器 向量空间变化需重新建库监控 token 数预估文本长度避免关键信息被截断测试截断影响对比完整文本 vs 截断后的向量相似度差异七、总结问题答案分词是谁做的分词器Tokenizer模型配套工具分词规则谁定预训练时的语料统计和词典文件超窗会怎样默认保前弃后后面 token 直接丢弃为什么维度固定Pooling 机制将变长 token 序列压缩为定长向量正确顺序是分词 → 截断 → 编码不可颠倒延伸阅读如果你正在构建 RAG 系统下一步可以深入了解文本分块Chunking策略按句子、按语义、按固定 token 数以及向量量化如何把 768 维浮点向量压缩为更低维表示节省 90% 存储空间。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑