📊 文本相似度计算器

免费在线文本相似度计算器,支持Levenshtein编辑距离、余弦相似度、Jaccard系数、Jaro-Winkler等多种算法。无需注册,数据绝不上传。 | 无需注册 · 数据绝不上传服务器

零依赖·可离线使用

多算法文本相似度对比:Levenshtein、余弦、Jaccard、Jaro-Winkler等

零依赖 · 可离线使用

📝 输入文本

🕐 历史记录

暂无记录

❓ 常见问题

支持哪些相似度算法?

支持Levenshtein编辑距离、余弦相似度、Jaccard系数、Jaro-Winkler相似度、Hamming距离、最长公共子序列(LCS)六种算法,可多选同时对比。

数据会上传到服务器吗?

不会。本工具采用纯前端技术,所有计算都在浏览器本地完成,数据绝不离开您的设备,即使断网也能正常使用。

Levenshtein和余弦相似度有什么区别?

Levenshtein衡量编辑操作次数,适合拼写检查;余弦相似度基于词频向量方向,适合文档语义比较。两者适用场景不同,建议同时对比查看。

支持批量比较吗?

支持。在批量对比区域输入多行文本,工具会计算每对文本之间的相似度,生成可视化对比矩阵。

Hamming距离为什么有时不可用?

Hamming距离要求两个字符串长度相同。如果长度不同,工具会提示长度不匹配,建议使用Levenshtein代替。

如何选择合适的算法?

拼写纠错用Levenshtein,文档去重用余弦,集合比较用Jaccard,人名匹配用Jaro-Winkler,等长编码比较用Hamming,序列比对用LCS。

结果可以导出吗?

可以。支持一键复制结果为纯文本,也可下载为CSV文件,方便在Excel或其他工具中进一步分析。

文本相似度计算器能做什么?

文本相似度计算器是一款免费在线工具,能够使用多种经典算法计算两段文本之间的相似程度。支持Levenshtein编辑距离、余弦相似度、Jaccard系数、Jaro-Winkler相似度、Hamming距离和最长公共子序列六种算法,可同时对比查看不同算法的结果差异。工具还支持批量文本的两两对比矩阵生成。所有计算在浏览器本地完成,数据绝不上传服务器。

核心功能

使用教程

1. 在"文本A"和"文本B"输入框中分别输入要比较的两段文本。

2. 勾选需要使用的相似度算法(默认已选Levenshtein、余弦、Jaccard、Jaro-Winkler)。

3. 点击"计算相似度"按钮,或直接输入文本后自动计算。

4. 查看各算法的相似度分数和可视化进度条,了解不同算法的差异。

5. 如需批量比较,在"批量对比矩阵"区域输入多行文本,点击"生成矩阵"。

6. 点击"复制结果"或"下载CSV"导出计算结果。

应用场景

场景1:开发者实现拼写检查

使用Levenshtein距离计算用户输入与词典词的编辑距离,找出最相似的推荐词,实现智能拼写纠错功能。

场景2:数据分析师文档去重

使用余弦相似度比较文档向量,快速发现重复或高度相似的文档,在数据清洗中高效去重。

场景3:运维日志异常检测

比较日志条目的相似度,发现异常模式。Jaccard系数适合比较日志关键词集合的重叠程度。

场景4:产品经理用户反馈聚类

收集大量用户反馈后,用文本相似度将相似意见聚类,快速识别高频问题和需求方向。

场景5:学生自然语言处理学习

直观对比不同相似度算法的结果差异,理解各算法的适用场景和计算原理,加深NLP基础认知。

扩展知识

文本相似度是自然语言处理的基础问题。Levenshtein距离由苏联数学家Vladimir Levenshtein于1965年提出,定义了将一个字符串变为另一个所需的最少单字符编辑操作数。余弦相似度源自向量空间模型,通过计算词频向量的夹角余弦值衡量方向相似性,广泛用于信息检索。Jaccard系数由Paul Jaccard提出,衡量两个集合的交集与并集之比,适合稀疏数据。Jaro-Winkler在Jaro距离基础上增加了前缀权重,对人名匹配特别有效。Hamming距离仅适用于等长字符串,计算对应位置不同的字符数。选择算法时需考虑:编辑类任务用Levenshtein,语义类用余弦,集合类用Jaccard,短字符串匹配用Jaro-Winkler。

文本相似度计算器 | 无需注册 · 数据绝不上传服务器

问题反馈: dexshuang@google.com