sábado, 25 de julho de 2026

UNIDIC ATUALIZADO… POR MIM!–PARTE 2

Nesta postagem eu disse que atualmente, a minha “versão personalizada” do UniDic conta(va) com 1.044.080 de entradas. Isso se deve ao fato de que eu aprendi a compilar o UniDic para o formato suportado pelo FuriGanbarou! e a adicionar novas palavras ao UniDic. Hoje, se você acessar o FuriGanbarou!, verá que a minha  “versão personalizada” do UniDic agora possui 1.052.240 de entradas!

Contudo, como isso é possível se eu havia dito que a versão do UniDic usada é a mais recente, que data de dezembro de 2025?

A questão aqui é que eu imaginava que as versões do UniDic fossem cumulativas, isto é, imaginei que a versão recente se tratasse de um acréscimo à versão anterior e assim sucessivamente. Entretanto, pelas minhas análises, parece que não é bem assim. Em outras palavras, as atualizações são cumulativas até certo ponto. Pode haver acréscimos, mas pode haver remoções também. Percebendo isso, eu fiz um ajuste pegando todas as bases oficiais já lançadas do UniDic e montando uma base realmente cumulativa, sem remoções.

Você pode pensar que os desenvolvedores do UniDic só removeriam palavras raras, mas não é o caso. Um exemplo é o termo “FIFA”, que não existe na versão de dezembro de 2025. A minha versão personalizada, porém:

FIFA    フィファ    *    名詞    固有名詞    一般    *    *    *    FIFA    8647660    KNOWN

Considerando que o futebol japonês tem evoluído muito nas últimas décadas, acredito que ninguém duvida que o termo “FIFA” NÃO é um termo raro. Ele existe no ENAMDICT, então, a segmentação seria revisada, mas julgo um erro dos desenvolvedores exclui-lo das versões mais recentes.

Foram por volta de 8.000 palavras adicionadas, o que torna a minha versão personalizada do UniDic realmente cumulativa e realmente a mais atualizada. Poderia até dizer que a minha versão personalizada está mais atualizada do que a própria versão oficial mais atualizada (risos!).

quarta-feira, 22 de julho de 2026

UNIDIC ATUALIZADO… POR MIM!

Nesta postagem, eu citei um caso de erro do UniDic, que segmenta 金曜日ごろに como 金曜  + 日ごろ (geralmente) e não como 金曜日 + ごろ. Bem, a partir de hoje esse erro não acontecerá mais, haja vista que atualizei o UniDic.

É por isso que eu gosto de ter controle sobre a arquitetura das coisas. Seria muito mais cômodo usar o Kuromoji + Ipadic, mas, como eu disse, são projetos que oficialmente não são atualizados há muito tempo, fato que me incomoda muito. 

Criando o FuriGanbarou! e aprendendo como dicionários morfológicos funcionam, posso melhorar toda a arquitetura a hora que eu quiser e como eu quiser. E dessa vez eu quis aumentar o número de entradas do UniDic. Atualmente, a minha “versão personalizada” do UniDic conta com 1.044.080 de entradas! Considerando que a segmentação é revisada pelo EDICT/ENAMDICT que são atualizados diariamente, diria que o FuriGanbarou! é o ÚNICO segmentador que existe que é “autossustentável”, haja vista que a segmentação tende a mudar para melhor a cada dia por causa de seu sistema de revisão/correção pioneiro atrelado às atualizações diárias do EDICT/ENAMDICT.

Eu achava que o jogo Super Ganbaroujin! fosse o projeto mais ambicioso do Ganbarou Ze! até então, mas eu estava enganado! O FuriGanbarou! tem sido o maior desafio. Porém, ao mesmo tempo, estou me divertindo bastante nessa jornada. Aliás, eu nunca imaginei que iria conseguir finalmente colocar todas as minhas ideias em prática depois de mais de 10 anos de projeto graças ao advento das IAs.

Se há gente que pensa que eu iria me entregar por causa da falta de colaboração do nicho, estão totalmente enganados. Pode até ser que eu não consiga alcançar meu objetivo principal, mas a hora que outro nicho resolver “adotar” esse projeto, ele vai decolar, pois o Projeto Ganbarou Ze! já está anos luz à frente de muita coisa por aí em questão de frutos. Eu não preciso ficar vendendo pão e circo e/ou cursos milagreiros. Aliás, se é somente a pão e circo e/ou cursos milagreiros que este nicho sabe dar moral, então, este nicho definitivamente não é indicado para pessoas que realmente querem crescer. O Japão acaba virando apenas instrumento para tentarem curar suas mazelas emocionais, assim como muitos instrumentalizam a política, a religião, etc. para o mesmo objetivo. Não é à toa que neste meio nos deparamos com muito fanatismo

terça-feira, 14 de julho de 2026

MAIS UMA EVOLUÇÃO DO FURIGANBAROU!–PARTE 2

Nesta postagem de ontem, eu disse que consegui adicionar as novas palavras da versão mais recente do UniDic, que data de dezembro de 2025. Um exemplo que eu usei foi da palavra 西甌 que, por ser uma nova adição da nova versão, acredito que todos os outros segmentadores falham.

Ontem eu sugeri a adição de 西甌 ao projeto EDICT, que foi aprovada ontem mesmo. Sendo assim, já consta na base de dados. Veja a mágica do FuriGanbarou!:

Como era uma palavra exclusiva da nova versão do UniDic, 西甌 aparecia no grupo “SEGMENTADOR”, que criei para cobrir esses casos específicos. Contudo, como 西甌 foi adicionada à base do EDICT, agora aparece no grupo “EDICT”.

Este é o diferencial do FuriGanbarou!: além de ser interativo, a segmentação estará sempre atualizada, visto que o FuriGanbarou! talvez seja o ÚNICO segmentador no mundo que tem suas bases atualizadas diariamente e segmenta com base na versão mais atual do UniDic, o dicionário morfológico considerado mais preciso atualmente. Nisto sem sombra de dúvidas o projeto Ganbarou Ze! é PIONEIRO.

Ah, e 西甌 significa “Xi Ou” (um grupo do povo Baiyue que habitava a região que hoje é Guangxi, região autônoma Zhuang da República Popular da China).

E sempre paira na minha cabeça o “E SE?”: E SE eu tivesse conseguido construir uma equipe/comunidade de pessoas VERDADEIRAMENTE comprometidas com a língua japonesa?

Certamente, faríamos do Brasil uma referência e exportador de talentos para o Japão…

Mas isso infelizmente é utópico. Salvo algumas exceções, este nicho é composto por parasitas e gente imatura que apenas USAM o Japão para venderem uma fachada de “pessoas do bem e superiores” e que só dão moral a quem valida justamente seus fetiches, imaturidades e fachada com abordagens e opiniões quase sempre retiradas do c…

E nesses mais de 12 anos de projeto, pude perceber como essas autoproclamadas “pessoas do bem e superiores” são VERDADEIRAMENTE.

segunda-feira, 13 de julho de 2026

MAIS UMA EVOLUÇÃO DO FURIGANBAROU!

Eu já disse que no fim das contas foi bom eu não ter conseguido colaboradores para o projeto. Eu gosto de inovar (e por que não dizer “revolucionar”) e se acordo de manhã com uma ideia, já quero tentar colocá-la em prática. Por isso, colaboradores humanos não me suportariam (risos!).

Com relação ao FuriGanbarou!, o projeto Ganbarou Ze! é pioneiro por criar um segmentador totalmente do zero, brasileiro e GRATUITO. O projeto Ganbarou Ze! é também pioneiro na metodologia, haja vista que o FuriGanbarou! segmenta e o EDICT/ENAMDICT, com suas bases atualizadas diariamente, revisam e corrigem a segmentação e os furiganas. Além disso, o projeto Ganbarou Ze! é também pioneiro por fazer do FuriGanbarou! um segmentador interativo, que possui um menu em que o usuário pode trocar o furigana bem como o usuário pode editar a segmentação.

Sem querer ser repetitivo e chato, é bom lembrar que o projeto Ganbarou Ze! é também pioneiro (risos!) por disponibilizar o primeiro segmentador gratuito e BRASILEIRO, com sistema automático de revisão e correção, interativo e com o UniDic, o dicionário morfológico considerado mais preciso e moderno atualmente.

Agora, de novo sem querer ser repetitivo e chato, o projeto Ganbarou Ze! é talvez também pioneiro (risos!) por criar o único segmentador disponível que usa a versão mais recente do UniDic, que data de dezembro de 2025.

Sim, eu já tinha ficado muito feliz por ter conseguido (aprendido a) compilar o UniDic para a arquitetura do FuriGanbarou!. E ontem, fiquei ainda mais feliz por ter conseguido (aprendido a) adicionar as novas palavras dessa versão mais recente de dezembro de 2025!

Cito como exemplo a palavra 西甌. Essa é uma das novas palavras adicionadas. Se formos consultar no MeCab/Unidic Demonstration do projeto EDICT, teremos:

Input Text

西甌

MeCab Segmentation

西 ニシ ニシ 西 名詞-普通名詞-一般

甌 甌 甌 甌 名詞-普通名詞-一般

Veja que é uma segmentação toda bugada, haja vista que claramente o “MeCab/Unidic Demonstration” utiliza uma versão mais antiga do UniDic. Agora, veja como o FuriGanbarou! segmenta:

 

Eu precisei atualizar o código para cobrir os casos em que a palavra existe no UniDic, mas não no EDICT/ENAMDICT. Como podem ver, esses casos aparecerão no grupo “SEGMENTADOR” tendo a classe gramatical que o UniDic atribuir a eles (no caso aqui “substantivo”).

É claro que se 西甌 entrar na base do EDICT/ENAMDICT, aí o EDICT/ENAMDICT tem prioridade. Aliás, vou sugerir a inclusão da palavra 西甌 ao projeto EDICT. Se ela for aprovada, no dia seguinte ao da aprovação já estará na base, e o FuriGanbarou! passará a mostrar 西甌 no grupo em que for adicionado (EDICT ou ENAMDICT).

Aguardem a próxima postagem…

terça-feira, 7 de julho de 2026

IPADIC VS. UNIDIC

Como venho falando, consegui finalmente compilar o UniDic para ser compatível e ser usado com o FuriGanbarou!. Entretanto, como também venho falando, NENHUM dicionário morfológico tem 100% de acerto, e é por isso que, ao criar o FuriGanbarou!, foi muito importante para mim que ele tivesse um sistema de revisão e correção, bem como a possiblidade de o próprio usuário editar a segmentação e as leituras.

Um exemplo de erro do UniDic é uma frase com a qual me deparei ontem (o furigana é do próprio site japonês):

台風(たいふう)は10日(とおか)金曜日(きんようび)ごろに沖縄(おきなわ)の近(ちか)くに来()るかもしれません。

Aqui o furigana obviamente está certo e significa “O tufão pode se aproximar de Okinawa por volta de sexta-feira, dia 10”. Eu criei um script para uso pessoal em que posso comparar a segmentação de diferentes dicionários. A parte que nos interessa aqui é “金曜日(きんようび)ごろに”. Veja:

=== TEXTO ANALISADO ===
金曜日ごろに

=== IPADIC (3 tokens) ===
#    surface_form    reading    pronunciation    pos    pos_detail_1    pos_detail_2    pos_detail_3    conjugated_type    conjugated_form    basic_form    word_id    word_type
1    金曜日    キンヨウビ    キンヨービ    名詞    副詞可能    *    *    *    *    金曜日    39400    KNOWN
2    ごろ    ゴロ    ゴロ    名詞    接尾    副詞可能    *    *    *    ごろ    158770    KNOWN
3    に    ニ    ニ    助詞    格助詞    一般    *    *    *    に    92030    KNOWN

=== UNIDIC (3 tokens) ===
#    surface_form    reading    pronunciation    pos    pos_detail_1    pos_detail_2    pos_detail_3    conjugated_type    conjugated_form    basic_form    word_id    word_type
1    金曜    キンヨウ    *    名詞    普通名詞    副詞可能    *    *    *    金曜    7270200    KNOWN
2    日ごろ    ヒゴロ    *    名詞    普通名詞    副詞可能    *    *    *    日頃    4979100    KNOWN
3    に    ニ    *    助詞    格助詞    *    *    *    *    に    1136480    KNOWN

Percebe a diferença? Neste exemplo, quem está certo é o IPADIC, que segmenta 金曜日 + ごろ e não 金曜  + 日ごろ (geralmente), como o UniDic.

E como o FuriGanbarou! agora usa o UniDic, ele segmenta: 金曜[きんよう]日[]ごろに. E para não pensarem que é erro do meu código, consultemos “金曜日ごろに” no MeCab/Unidic Demonstration do próprio projeto EDICT:

金曜	キンヨー	キンヨウ	金曜	名詞-普通名詞-副詞可能		

日ごろ	ヒゴロ	ヒゴロ	日頃	名詞-普通名詞-副詞可能		

に	ニ	ニ	に	助詞-格助詞		

É o mesmo resultado. Aliás, aqui entra o diferencial do FuriGanbarou!, já que é possível corrigir a segmentação através da FUSÃO:

金曜日[きんようび]ごろに

quinta-feira, 2 de julho de 2026

O ÁPICE DO FURIGANBAROU? – PARTE 2

Nesta semana, o FuriGanbarou! passou por mais uma rodada de atualizações, na qual corrigi alguns bugs e melhorei o motor de segmentação.

Sim, talvez muitos de vocês podem ter pensado que eu usei algum segmentador conhecido no FuriGanbarou! (como Kuromoji, Mecab, etc.), mas NÃO é o caso. Com a ajuda dos meus “programadores virtuais”, o segmentador do FuriGanbarou! foi 100% criado do zero!

O motivo disso é que os segmentadores mais conhecidos NÃO são atualizados há muito tempo e isso é algo que me chateia demais. Então, preferi criar um segmentador “do zero” para que eu pudesse ter controle total sobre o código e possa mantê-lo sempre atualizado.

Considerando que eu consegui compilar uma versão do UNIDIC, o dicionário morfológico considerado muito mais preciso do que o IPADIC, posso dizer que o FurGanbarou! é o injetor/editor de furiganas mais moderno e avançado que existe, até por que é totalmente integrado às atualizações DIÁRIAS do EDICT/ENAMDICT, sendo pioneiro neste aspecto.

Como eu disse na postagem anterior, o FuriGanbarou! funciona basicamente assim:

(1) Segmentação através de um segmentador totalmente autoral que usa o UNIDIC(2) Revisão e correção através das bases atualizadas diariamente do EDICT/ENAMDICT

Um exemplo do EDICT/ENAMDICT revisando e corrigindo a segmentação do FuriGanbarou! é o sufixo 期生, que entrou na base do EDICT/ENAMDICT  na atualização de HOJE, 02/07/2026: até ontem o FuriGanbarou segmentava como 期[き]生[せい], mas partir de hoje já segmenta 期生[きせい] com classe gramatical “sufixo”.

Eu até pensei em tornar público o código do FuriGanbarou! para facilitar a detecção e correção de bugs, bem como a implementação de melhorias.

Mas vocês já sabem...

Acho que é muito mais fácil acontecer um MILAGRE e eu largar as muletas do que alguém deste nicho deserto e parasita colaborar de fato para alguma coisa neste projeto. Existe o GitHub, mas como eu sempre digo: quero preservar a identidade BRASILEIRA do projeto para que ele seja uma porta para oportunidades PARA BRASILEIROS (descendentes ou não).

Como eu sempre digo também, eu fico muito incomodado com o fato de o Brasil ter a maior população japonesa fora do Japão, mas NÃO ter as ferramentas mais inovadoras com relação ao ensino da língua japonesa (aliás, onde estão os frutos dos muitos falastrões autonomeados “especialistas de Japão” que existem na internet???). E me incomoda também o certo desprezo ao Brasil que há por parte dos japoneses, à pátria que os acolheu e lhes deu muitas oportunidades. Eu fico até irritado quando vejo criadores de conteúdo japoneses agindo como se o mundo se resumisse a Europa e Estados Unidos. Eu costumo entrar em contato com TODOS eles falando da importância que o Brasil teve e tem para os japoneses, mas sem sucesso.

Agora quando é pra caçar likes para ostentar grande número de seguidores e forte engajamento (e atrair patrocínios e participação em eventos) às custas dos brasileiros sem dar aos BRASILEIROS retorno real e proporcional…

Bom… deixemos isso pra lá…Smile with tongue out

domingo, 21 de junho de 2026

O ÁPICE DO FURIGANBAROU?

Depois de mais de 2 meses do lançamento do FuriGanbarou! e muitos ajustes posso dizer que estou muito feliz com o resultado. Ainda mais por que nesta semana, depois de muita pesquisa e conversa com meus “programadores virtuais”, diria que conquistei meu MAIOR objetivo para o Furiganbarou!: usar como dicionário de segmentação o UNIDIC!!!

Eu não sou programador e, portanto, sou leigo no assunto. Contudo, de forma simplista, segmentadores de textos japoneses usam lógica e um dicionário morfológico, que possuem a palavra, a leitura, a classe gramatical e o “custo de conexão”, que seria, novamente de forma simplista, uma probabilidade que indica a quais palavras uma determinada palavra tende a se conectar com mais frequência considerando o contexto. Até onde eu entendi sobre o assunto, esse custo de conexão é obtido pela análise de banco de dados de sentenças.

Nenhum dicionário morfológico acertará TUDO obviamente, pois estamos falando de probabilidades. Porém, existem dicionários mais precisos e menos precisos. E quanto mais precisos forem, mais pesados eles tendem a ser obviamente. Esse é o caso do UNIDIC: ele é talvez o dicionário morfológico mais preciso que existe atualmente, mas essa precisão tem um preço, que é o tamanho da sua, digamos, lógica de cálculo de custos de conexão.

Por isso mesmo, a maioria dos segmentadores usam o IPADIC, um dicionário morfológico leve, com um nível de precisão aceitável, mas que não é atualizado oficialmente desde 2007. O que mais me incomoda com relação ao IPADIC é justamente o fato de ele estar abandonado oficialmente falando. Por essa razão, ao criar o FuriGanbarou!, eu quis compensar essa desatualização do IPADIC com o EDICT/EMANDICT e o KANJIDIC. Por conta disso, o FuriGanbarou tem uma lógica complexa para um princípio simples:

“O EDICT/EMANDICT/KANJIDIC, por terem bases mais recentes, são os revisores do trabalho do segmentador com o IPADIC”

Isso parece simples, mas nesses dois meses fui me convencendo de que há muitas incoerências no tratamento de dados por parte do IPADIC, o que estava exigindo de mim criar mais e mais lógicas de revisão e correção e cada vez mais complexas. Só para ter uma ideia, atualmente o FuriGanbarou! tem mais de 20.000 linhas de código! Para um trabalho solitário de quem não é programador profissional, isso parecia não ter fim.

O fato de conseguir finalmente compilar o UNIDIC para usá-lo com o FuriGanbarou! é uma grande conquista, pois agora temos um dicionário morfológico mais recente e mais preciso (com cerca de 800.000 palavras), sem contar o código robusto de revisão e correção por meio do EDICT/EMANDICT/KANJIDIC (com mais de 1 milhão de entradas).

Dito isso, o FuriGanbarou! não é apenas mais um simples injetor de furiganas, mas é também um EDITOR AVANÇADO de furiganas que usa as bases mais recentes e mais precisas possíveis. É uma ferramenta ÚNICA no Brasil e talvez no MUNDO considerando o conjunto. E é uma ferramenta gratuita e BRASILEIRA!

Ah, e agora é possível copiar o texto com furiganas em cima do texto:

カーボベルデ出身しゅっしんのゴールキーパー、ヴォジーニャは40歳よんじゅうさいで、ありないとおもわれていた軌道きどう壮大そうだいゆめ実現じつげんしようとしている。= O goleiro Vozinha, originário de Cabo Verde, tem 40 anos e está prestes a realizar um grande sonho em uma trajetória que parecia impossível.