spaCy/spacy/lang/pt/lex_attrs.py

# coding: utf8
from __future__ import unicode_literals

from ...attrs import LIKE_NUM


_num_words = ['zero', 'um', 'dois', 'três', 'tres', 'quatro', 'cinco', 'seis', 'sete', 'oito', 'nove', 'dez',
              'onze', 'doze', 'dúzia', 'dúzias', 'duzia', 'duzias', 'treze', 'catorze', 'quinze', 'dezasseis', 
              'dezassete', 'dezoito', 'dezanove', 'vinte', 'trinta', 'quarenta', 'cinquenta', 'sessenta',
              'setenta', 'oitenta', 'noventa', 'cem', 'cento', 'duzentos', 'trezentos', 'quatrocentos',
              'quinhentos', 'seicentos', 'setecentos', 'oitocentos', 'novecentos', 'mil', 'milhão', 'milhao',
              'milhões', 'milhoes', 'bilhão', 'bilhao', 'bilhões', 'bilhoes', 'trilhão', 'trilhao', 'trilhões',
              'trilhoes', 'quadrilhão', 'quadrilhao', 'quadrilhões', 'quadrilhoes']


_ordinal_words = ['primeiro', 'segundo', 'terceiro', 'quarto', 'quinto', 'sexto',
                  'sétimo', 'oitavo', 'nono', 'décimo', 'vigésimo', 'trigésimo',
                  'quadragésimo', 'quinquagésimo', 'sexagésimo', 'septuagésimo',
                  'octogésimo', 'nonagésimo', 'centésimo', 'ducentésimo',
                  'trecentésimo', 'quadringentésimo', 'quingentésimo', 'sexcentésimo',
                  'septingentésimo', 'octingentésimo', 'nongentésimo', 'milésimo',
                  'milionésimo', 'bilionésimo']


def like_num(text):
    text = text.replace(',', '').replace('.', '').replace('º','').replace('ª','')
    if text.isdigit():
        return True
    if text.count('/') == 1:
        num, denom = text.split('/')
        if num.isdigit() and denom.isdigit():
            return True
    if text.lower() in _num_words:
        return True
    if text.lower() in _ordinal_words:
        return True
    return False


LEX_ATTRS = {
    LIKE_NUM: like_num
}
Reorganise Portuguese language data 2017-05-08 16:52:01 +03:00			`# coding: utf8`
			`from __future__ import unicode_literals`

Update Portuguese lexical attributes 2017-05-12 16:37:39 +03:00			`from ...attrs import LIKE_NUM`
Reorganise Portuguese language data 2017-05-08 16:52:01 +03:00

Add words to portuguese language _num_words (#2759) * Add words to portuguese language _num_words * Add words to portuguese language _num_words 2018-09-14 13:30:16 +03:00			`_num_words = ['zero', 'um', 'dois', 'três', 'tres', 'quatro', 'cinco', 'seis', 'sete', 'oito', 'nove', 'dez',`
			`'onze', 'doze', 'dúzia', 'dúzias', 'duzia', 'duzias', 'treze', 'catorze', 'quinze', 'dezasseis',`
			`'dezassete', 'dezoito', 'dezanove', 'vinte', 'trinta', 'quarenta', 'cinquenta', 'sessenta',`
			`'setenta', 'oitenta', 'noventa', 'cem', 'cento', 'duzentos', 'trezentos', 'quatrocentos',`
			`'quinhentos', 'seicentos', 'setecentos', 'oitocentos', 'novecentos', 'mil', 'milhão', 'milhao',`
			`'milhões', 'milhoes', 'bilhão', 'bilhao', 'bilhões', 'bilhoes', 'trilhão', 'trilhao', 'trilhões',`
			`'trilhoes', 'quadrilhão', 'quadrilhao', 'quadrilhões', 'quadrilhoes']`

Reorganise Portuguese language data 2017-05-08 16:52:01 +03:00
Rename variable to keep code consistent 2018-01-08 05:38:44 +03:00			`_ordinal_words = ['primeiro', 'segundo', 'terceiro', 'quarto', 'quinto', 'sexto',`
			`'sétimo', 'oitavo', 'nono', 'décimo', 'vigésimo', 'trigésimo',`
			`'quadragésimo', 'quinquagésimo', 'sexagésimo', 'septuagésimo',`
			`'octogésimo', 'nonagésimo', 'centésimo', 'ducentésimo',`
			`'trecentésimo', 'quadringentésimo', 'quingentésimo', 'sexcentésimo',`
			`'septingentésimo', 'octingentésimo', 'nongentésimo', 'milésimo',`
			`'milionésimo', 'bilionésimo']`
Reorganise Portuguese language data 2017-05-08 16:52:01 +03:00
Update Portuguese lexical attributes 2017-05-12 16:37:39 +03:00
			`def like_num(text):`
Update Portuguese Language (#2790) * Add words to portuguese language _num_words * Add words to portuguese language _num_words * Portuguese - Add/remove stopwords, fix tokenizer, add currency symbols * Extended punctuation and norm_exceptions in the Portuguese language 2018-09-29 10:51:45 +03:00			`text = text.replace(',', '').replace('.', '').replace('º','').replace('ª','')`
Update Portuguese lexical attributes 2017-05-12 16:37:39 +03:00			`if text.isdigit():`
			`return True`
			`if text.count('/') == 1:`
			`num, denom = text.split('/')`
			`if num.isdigit() and denom.isdigit():`
			`return True`
Find lowercased forms of numeric words 2018-01-08 05:25:08 +03:00			`if text.lower() in _num_words:`
Update Portuguese lexical attributes 2017-05-12 16:37:39 +03:00			`return True`
Find lowercased forms of ordinal words, where possible 2018-01-08 05:28:50 +03:00			`if text.lower() in _ordinal_words:`
			`return True`
Update Portuguese lexical attributes 2017-05-12 16:37:39 +03:00			`return False`


			`LEX_ATTRS = {`
			`LIKE_NUM: like_num`
			`}`