🧩 AI文本分块器

免费在线AI文本分块器,为RAG检索增强生成优化文本分块。支持固定大小、句子、段落、语义分块,可调节重叠和Token计数。无需注册。 | 无需注册 · 数据绝不上传服务器

零依赖·可离线使用

📝 输入文本

粘贴需要分块的长文本,为RAG检索增强生成系统优化文本切分。

⚙️ 分块参数

642048
0512

📖 AI文本分块详解

什么是文本分块?

文本分块(Chunking)是RAG(检索增强生成)系统的核心预处理步骤。将长文档切分为适当大小的片段,每个片段被转换为向量嵌入(Embedding),存入向量数据库供AI模型检索。

分块策略对比

  • 固定大小分块:按字符/Token数切分,简单高效,但可能在句子中间截断
  • 句子分块:按句子边界切分,保持语义完整,适合短文本
  • 段落分块:按段落切分,保留主题连贯性,适合结构化文档
  • 递归分块:按分隔符层级递归切分(段落→句子→字符),兼顾语义和大小

最佳实践

  1. 分块大小建议256-512 Token,兼顾检索精度和上下文完整性
  2. 设置10-20%重叠,避免关键信息被截断在边界处
  3. 为每个分块添加元数据(来源、位置、标题)提升检索质量
  4. 结构化文档(HTML/Markdown)优先按标题层级分块
  5. 不同类型文档使用不同策略:技术文档用递归分块,对话用句子分块

❓ 常见问题

什么是AI文本分块(Chunking)?

AI文本分块是将长文本切分为较小片段的过程,用于RAG(检索增强生成)系统。分块后的文本片段被转换为向量嵌入,存入向量数据库,供AI模型检索相关内容。合理的分块策略直接影响检索质量和生成效果。

常见的分块策略有哪些?

常见策略包括:1)固定大小分块-按字符数或Token数切分;2)句子分块-按句子边界切分,保持语义完整;3)段落分块-按段落切分,保留主题连贯性;4)递归分块-按分隔符层级递归切分。选择策略取决于文本类型和应用场景。

为什么分块需要重叠(Overlap)?

重叠确保相邻分块之间有共享内容,避免关键信息被截断在分块边界处。例如一个句子被切在两个分块之间,检索时可能只找到一半。通常设置10-20%的重叠率。

分块大小应该设多少?

分块大小取决于嵌入模型的限制和应用需求。OpenAI text-embedding-3-small最大8191 Token,通常建议256-512 Token的分块。较小的分块检索更精准但可能丢失上下文,较大的分块上下文更完整但可能引入噪声。

数据会上传到服务器吗?

不会。所有文本分块处理都在浏览器本地完成,不发送任何数据到服务器。您的文本内容完全在本地处理。

AI文本分块器 | 无需注册 · 数据绝不上传服务器

问题反馈: dexshuang@google.com