Tokenization
Tokenizer factories in Deeplearning4j — DefaultTokenizerFactory, custom tokenizers, and preprocessors
The Two-Level Interface
public interface TokenizerFactory {
Tokenizer create(String toTokenize);
Tokenizer create(InputStream toTokenize);
void setTokenPreProcessor(TokenPreProcess preProcessor);
TokenPreProcess getTokenPreProcessor();
}public interface Tokenizer {
boolean hasMoreTokens();
int countTokens();
String nextToken();
List<String> getTokens();
void setTokenPreProcessor(TokenPreProcess tokenPreProcessor);
}DefaultTokenizerFactory
Token Preprocessors
CommonPreprocessor
LowCasePreProcessor
EndingPreProcessor
NGramTokenizerFactory
UimaTokenizerFactory
Using a TokenizerFactory Directly
Creating a Custom TokenizerFactory
Stop Word Filtering
Further Reading
Last updated
Was this helpful?