✂️ 文本分块工具

专为AI/LLM/RAG设计的智能文本分块工具,支持字符/Token/段落/句子四种策略

零依赖·可离线使用

📝 输入文本

文本分块工具能做什么?

文本分块工具是一款专为AI/LLM/RAG场景设计的免费在线工具,能够将长文本智能切分为多个较短的片段。支持按字符数、Token数、段落和句子四种分块策略,每种策略都可配置块大小和重叠长度,确保语义连续性。所有计算在浏览器本地完成,数据绝不上传服务器。

核心功能

  • 四种分块策略:按字符数、按Token数(近似GPT Tokenizer)、按段落、按句子,灵活适配不同场景
  • 可配置重叠:支持设置分块间的重叠长度,避免关键信息被切断在边界处
  • Token估算:近似GPT Tokenizer的Token计数,帮助匹配模型上下文窗口限制
  • 实时统计:显示分块数、总字符数、总Token数、平均块长等关键指标
  • 多格式导出:支持复制为JSON、下载JSON文件、下载TXT文件
  • 逐块查看:每个分块独立展示,显示序号、字符数、Token数,支持单独复制

使用教程

1. 在输入框中粘贴需要分块的长文本。

2. 选择分块策略:按字符数适合简单切分,按Token数适合匹配LLM上下文限制,按段落/句子适合保持语义完整。

3. 设置块大小(每个分块的最大长度)和重叠长度(相邻分块的重叠部分)。

4. 点击"执行分块"查看结果,每个分块显示序号、字符数和Token数。

5. 复制或下载分块结果,用于RAG管道或LLM处理。

应用场景

场景1:RAG检索增强生成

将文档库中的长文档分块后存入向量数据库,用户查询时检索最相关的分块,提供给LLM生成回答。分块大小和重叠直接影响检索质量。

场景2:LLM长文本处理

当文本超过模型上下文窗口限制时,将文本分块后逐块处理,最后合并结果。Token分块策略可精确匹配模型限制。

场景3:数据预处理

在机器学习数据预处理中,将长文档切分为训练样本,按段落或句子分块可保持语义完整性。

场景4:内容摘要

对长文章先分块再逐块摘要,最后汇总生成全文摘要,避免LLM遗漏关键信息。

扩展知识

文本分块是RAG系统的核心预处理步骤。常见的分块策略包括:固定大小分块(简单但可能切断语义)、基于句子的分块(保持句子完整但块大小不均匀)、基于段落的分块(保持段落完整但块可能过长)、递归分块(LangChain的RecursiveCharacterTextSplitter,优先按段落→句子→字符递归切分)。重叠(Overlap)是保证分块间语义连续性的关键,通常设置为块大小的10-20%。Token计数方面,GPT系列模型使用BPE Tokenizer,1个中文字约1-2个Token,1个英文单词约1个Token,本工具采用近似估算算法。

常见问题

什么是文本分块?

文本分块(Text Chunking)是将长文本按一定规则切分为多个较短的片段,常用于RAG检索增强生成、LLM上下文窗口限制处理、向量数据库索引等AI场景。

Token分块和字符分块有什么区别?

Token分块按AI模型的Token计数切分(1个中文字约1-2个Token,1个英文单词约1个Token),更精确匹配模型上下文限制。字符分块按字符数切分,简单直观但可能与模型实际消耗不一致。

为什么需要重叠(Overlap)?

重叠确保相邻分块之间有重复内容,避免关键信息被切断在分块边界处。通常设置10-20%的重叠率,保证语义连续性。

数据会上传到服务器吗?

不会。本工具采用纯前端技术,所有分块计算都在浏览器本地完成,数据绝不离开您的设备,即使断网也能正常使用。

支持哪些分块策略?

支持四种策略:按字符数分块、按Token数分块(近似GPT Tokenizer)、按段落分块、按句子分块。每种策略都可配置块大小和重叠长度。

分块结果可以导出吗?

可以。支持复制单个分块、复制全部分块为JSON格式、下载为JSON或TXT文件,方便直接用于RAG管道。

文本分块工具 | 无需注册 · 数据绝不上传服务器

问题反馈: dexshuang@google.com