package cn.edu.bjut.textmining.chapter2; import com.hankcs.hanlp.HanLP; import com.hankcs.hanlp.seg.common.Term; import java.util.ArrayList; import java.util.List; /** * HanLP 中文分词示例。 * 中文文本没有天然的词间空格,成熟分词工具会结合词典与统计模型判断词语边界。 * 本示例与 ChineseTextPreprocessingDemo 的小词典最长优先分词使用同一条校园通知, * 便于对照两类方法的切分差异。 */ public class HanlpSegmentDemo { public static void main(String[] args) { String sentence = "学习委员提醒:明天下午的《高等数学》习题课改到三教302," + "请带教材、笔、作业本和草稿纸!"; List terms = HanLP.segment(sentence); System.out.println("原句:" + sentence); List words = new ArrayList(); for (Term term : terms) { words.add(term.word); } System.out.println("词元序列:"); System.out.println(words); System.out.println("词元与词性:"); for (Term term : terms) { System.out.println(term.word + "/" + term.nature); } } }