📝 输入文本
粘贴需要分块的长文本,为RAG检索增强生成系统优化文本切分。
⚙️ 分块参数
642048
0512
📖 AI文本分块详解
什么是文本分块?
文本分块(Chunking)是RAG(检索增强生成)系统的核心预处理步骤。将长文档切分为适当大小的片段,每个片段被转换为向量嵌入(Embedding),存入向量数据库供AI模型检索。
分块策略对比
- 固定大小分块:按字符/Token数切分,简单高效,但可能在句子中间截断
- 句子分块:按句子边界切分,保持语义完整,适合短文本
- 段落分块:按段落切分,保留主题连贯性,适合结构化文档
- 递归分块:按分隔符层级递归切分(段落→句子→字符),兼顾语义和大小
最佳实践
- 分块大小建议256-512 Token,兼顾检索精度和上下文完整性
- 设置10-20%重叠,避免关键信息被截断在边界处
- 为每个分块添加元数据(来源、位置、标题)提升检索质量
- 结构化文档(HTML/Markdown)优先按标题层级分块
- 不同类型文档使用不同策略:技术文档用递归分块,对话用句子分块
❓ 常见问题
什么是AI文本分块(Chunking)?
AI文本分块是将长文本切分为较小片段的过程,用于RAG(检索增强生成)系统。分块后的文本片段被转换为向量嵌入,存入向量数据库,供AI模型检索相关内容。合理的分块策略直接影响检索质量和生成效果。
常见的分块策略有哪些?
常见策略包括:1)固定大小分块-按字符数或Token数切分;2)句子分块-按句子边界切分,保持语义完整;3)段落分块-按段落切分,保留主题连贯性;4)递归分块-按分隔符层级递归切分。选择策略取决于文本类型和应用场景。
为什么分块需要重叠(Overlap)?
重叠确保相邻分块之间有共享内容,避免关键信息被截断在分块边界处。例如一个句子被切在两个分块之间,检索时可能只找到一半。通常设置10-20%的重叠率。
分块大小应该设多少?
分块大小取决于嵌入模型的限制和应用需求。OpenAI text-embedding-3-small最大8191 Token,通常建议256-512 Token的分块。较小的分块检索更精准但可能丢失上下文,较大的分块上下文更完整但可能引入噪声。
数据会上传到服务器吗?
不会。所有文本分块处理都在浏览器本地完成,不发送任何数据到服务器。您的文本内容完全在本地处理。