ossean/match_program/util/Extractor.java

35 lines
869 B
Java

package com.star.util;
import java.io.IOException;
import java.io.Reader;
import java.io.StringReader;
import java.util.LinkedList;
import java.util.List;
import org.wltea.analyzer.core.IKSegmenter;
import org.wltea.analyzer.core.Lexeme;
public class Extractor {
public static List<String> extractAtoms(String str){
//System.out.print(name + ">>>");
str = Normalizer.normalize(str);
//System.out.print(name + ">>>");
Reader text = new StringReader(str);
IKSegmenter iks = new IKSegmenter(text, true);
Lexeme term = null;
List<String> items = new LinkedList<String>();
try {
while((term = iks.next()) != null){
items.add(term.getLexemeText().toString());
}
} catch (IOException e) {
// TODO Auto-generated catch block
e.printStackTrace();
System.out.println("分词出现错误");
System.exit(1);
}
return items;
}
}