spaCy/spacy/lang/ja/__init__.py

# encoding: utf8
from __future__ import unicode_literals, print_function

from ...language import Language
from ...attrs import LANG
from ...tokens import Doc
from ...tokenizer import Tokenizer


class JapaneseTokenizer(object):
    def __init__(self, cls, nlp=None):
        self.vocab = nlp.vocab if nlp is not None else cls.create_vocab(nlp)
        try:
            from janome.tokenizer import Tokenizer
        except ImportError:
            raise ImportError("The Japanese tokenizer requires the Janome "
                              "library: https://github.com/mocobeta/janome")
        self.tokenizer = Tokenizer()

    def __call__(self, text):
        words = [x.surface for x in self.tokenizer.tokenize(text)]
        return Doc(self.vocab, words=words, spaces=[False]*len(words))


class JapaneseDefaults(Language.Defaults):
    @classmethod
    def create_tokenizer(cls, nlp=None):
        return JapaneseTokenizer(cls, nlp)


class Japanese(Language):
    lang = 'ja'
    Defaults = JapaneseDefaults

    def make_doc(self, text):
        return self.tokenizer(text)


__all__ = ['Japanese']
Add basic japanese support 2017-05-03 07:56:21 +03:00			`# encoding: utf8`
			`from __future__ import unicode_literals, print_function`

Fix relative imports 2017-05-08 23:29:04 +03:00			`from ...language import Language`
			`from ...attrs import LANG`
			`from ...tokens import Doc`
Port over changes from #1157 2017-10-14 14:11:39 +03:00			`from ...tokenizer import Tokenizer`


			`class JapaneseTokenizer(object):`
			`def __init__(self, cls, nlp=None):`
			`self.vocab = nlp.vocab if nlp is not None else cls.create_vocab(nlp)`
			`try:`
			`from janome.tokenizer import Tokenizer`
			`except ImportError:`
			`raise ImportError("The Japanese tokenizer requires the Janome "`
			`"library: https://github.com/mocobeta/janome")`
			`self.tokenizer = Tokenizer()`

			`def __call__(self, text):`
			`words = [x.surface for x in self.tokenizer.tokenize(text)]`
			`return Doc(self.vocab, words=words, spaces=[False]*len(words))`


			`class JapaneseDefaults(Language.Defaults):`
			`@classmethod`
			`def create_tokenizer(cls, nlp=None):`
			`return JapaneseTokenizer(cls, nlp)`
Add basic japanese support 2017-05-03 07:56:21 +03:00

			`class Japanese(Language):`
			`lang = 'ja'`
Port over changes from #1157 2017-10-14 14:11:39 +03:00			`Defaults = JapaneseDefaults`
Add basic japanese support 2017-05-03 07:56:21 +03:00
			`def make_doc(self, text):`
Fix Japanese tokenizer JapaneseTokenizer now returns a Doc, not individual words 2017-10-24 14:02:19 +03:00			`return self.tokenizer(text)`
adding export japanese 2017-05-03 12:07:29 +03:00
Reorganise Japanese language data 2017-05-08 16:50:46 +03:00
			`__all__ = ['Japanese']`