文本相似度计算器能做什么?
文本相似度计算器是一款免费在线工具,能够使用多种经典算法计算两段文本之间的相似程度。支持Levenshtein编辑距离、余弦相似度、Jaccard系数、Jaro-Winkler相似度、Hamming距离和最长公共子序列六种算法,可同时对比查看不同算法的结果差异。工具还支持批量文本的两两对比矩阵生成。所有计算在浏览器本地完成,数据绝不上传服务器。
核心功能
- 六种算法对比:Levenshtein编辑距离、余弦相似度、Jaccard系数、Jaro-Winkler、Hamming距离、LCS最长公共子序列,勾选即用
- 实时计算:输入文本后实时展示各算法的相似度分数、可视化进度条和详细说明
- 批量对比矩阵:输入多行文本,自动生成两两对比的热力矩阵,一目了然
- 多格式导出:支持复制结果为纯文本、下载为CSV文件,方便进一步分析
- 历史记录:自动保存最近5次计算记录,方便回顾对比
- 示例数据:内置典型示例,打开即可看到效果
使用教程
1. 在"文本A"和"文本B"输入框中分别输入要比较的两段文本。
2. 勾选需要使用的相似度算法(默认已选Levenshtein、余弦、Jaccard、Jaro-Winkler)。
3. 点击"计算相似度"按钮,或直接输入文本后自动计算。
4. 查看各算法的相似度分数和可视化进度条,了解不同算法的差异。
5. 如需批量比较,在"批量对比矩阵"区域输入多行文本,点击"生成矩阵"。
6. 点击"复制结果"或"下载CSV"导出计算结果。
应用场景
场景1:开发者实现拼写检查
使用Levenshtein距离计算用户输入与词典词的编辑距离,找出最相似的推荐词,实现智能拼写纠错功能。
场景2:数据分析师文档去重
使用余弦相似度比较文档向量,快速发现重复或高度相似的文档,在数据清洗中高效去重。
场景3:运维日志异常检测
比较日志条目的相似度,发现异常模式。Jaccard系数适合比较日志关键词集合的重叠程度。
场景4:产品经理用户反馈聚类
收集大量用户反馈后,用文本相似度将相似意见聚类,快速识别高频问题和需求方向。
场景5:学生自然语言处理学习
直观对比不同相似度算法的结果差异,理解各算法的适用场景和计算原理,加深NLP基础认知。
扩展知识
文本相似度是自然语言处理的基础问题。Levenshtein距离由苏联数学家Vladimir Levenshtein于1965年提出,定义了将一个字符串变为另一个所需的最少单字符编辑操作数。余弦相似度源自向量空间模型,通过计算词频向量的夹角余弦值衡量方向相似性,广泛用于信息检索。Jaccard系数由Paul Jaccard提出,衡量两个集合的交集与并集之比,适合稀疏数据。Jaro-Winkler在Jaro距离基础上增加了前缀权重,对人名匹配特别有效。Hamming距离仅适用于等长字符串,计算对应位置不同的字符数。选择算法时需考虑:编辑类任务用Levenshtein,语义类用余弦,集合类用Jaccard,短字符串匹配用Jaro-Winkler。