词频统计工具

在线词频统计工具,统计文本中每个英文单词或中文分词后的词语出现次数,按频次降序排列,适合文案分析、关键词密度分析和文本挖掘。

工具介绍

词频统计工具支持对英文和中文文本进行词汇出现频率统计,可自定义最小词长、停用词过滤和显示结果数量,方便用于文本分析、写作优化、SEO分析等场景。

使用方法

  1. 在「输入文本」框粘贴需要统计词频的文本内容
  2. 选择统计模式:英文单词统计、中文单字统计、中文二字滑动统计、中文三字滑动统计
  3. 设置最小词长(仅英文统计生效,过滤过短词汇)和需要显示的Top N结果
  4. 在停用词框输入需要过滤的词汇(每行一个),统计时会自动排除这些词汇
  5. 点击「开始统计」即可查看统计结果,包含总词数、不同词汇数和按词频排序的表格

统计原理

  • 英文统计:按字母提取单词,自动转小写,过滤长度小于最小词长和停用词列表中的词汇
  • 中文统计:
    • 单字统计:逐个提取汉字,过滤停用词
    • N字滑动统计:从文本第一个字开始,滑动窗口每次移动一个字,提取连续N个汉字作为词汇,过滤停用词
  • 频率占比 = 当前词汇出现次数 ÷ 统计到的总词汇数 × 100%

注意事项

中文滑动统计不需要分词库,适合短文本词频统计。如果需要准确的中文分词词频统计,建议使用专业分词工具处理后再导入本工具。本工具统计结果仅供参考,不构成专业分析建议。

中文统计为什么不支持分词?

为了保持工具纯前端运行且不依赖外部分词库,本工具仅提供滑动N-gram统计和单字统计。如果您已经有分词结果,可以将分词后用空格分隔的文本导入,选择英文统计模式即可得到分词后的词频。

停用词有什么作用?

停用词是文本中高频但无实际意义的词汇,比如英文的the、a,中文的的、我、你等。过滤停用词可以让统计结果更聚焦于有实际意义的词汇,提升统计价值。

什么是二字/三字滑动统计?

滑动统计就是从文本第一个字开始,每次连续取2个或3个汉字作为一个词汇,然后向后移动一个字继续取下一组,比如「我爱你」二字滑动会得到「我爱」、「爱你」两个词汇。这种方法不需要分词即可统计,适合短文本分析。

频率占比是什么意思?

频率占比表示当前词汇出现的次数占总统计词汇数的百分比,占比越高说明该词汇在文本中出现越频繁,可以帮助你快速找到文本中的核心词汇。