laborator.io

carregando o modelo…


Um modelo de linguagem treinado do zero, no Brasil, com cada token licenciado.

Nenhum peso herdado. O corpus, o tokenizador, o treino e o pós-treino são nossos, e a procedência de cada fonte está aberta abaixo — fonte por fonte, licença por licença. É a única parte deste projeto que já está pronta, e é de propósito que ela venha primeiro.


Onde o projeto está

O primeiro modelo existe e não presta. Sabemos exatamente por quê.

O lab-150m foi treinado do zero e responde: forma correta, português bem construído, fatos inventados. Ele não está aberto ao público porque não seria honesto chamar aquilo de assistente. Duas medidas explicam tudo, e nenhuma delas é surpresa depois de medida.

Por que o lab-150m erra
Medidalab-150m ReferênciaO que significa
Tokens por parâmetro 1914.800 O SmolLM2-135M é menor que o nosso e leu 2 trilhões de tokens. Dimensionamos pelo ótimo de Chinchilla, que é ótimo para o custo de treino — não para um modelo utilizável.
Português não-administrativo 6,2% 93,8% do português que ele leu é diário oficial, DOU e discurso de plenário. Ele nunca viu, em português, uma frase que explique o que uma coisa é.
Instruções em português 44024.077 O pós-treino é 98% inglês e espanhol. Ele aprendeu a responder; não aprendeu em que língua.

O que vem agora, nesta ordem: prosa expositiva no corpus em todas as línguas que o modelo fala, treino muito além do ponto de Chinchilla, e pós-treino equilibrado entre elas. O modelo volta para esta página quando sustentar uma resposta.


O que já está provado. A linha inteira de produção funciona, do texto bruto ao modelo respondendo: coleta com licença verificada por item, deduplicação, tokenizador próprio, decoder escrito do zero, pré-treino e pós-treino supervisionado. Nenhum peso herdado de ninguém. O que falta é escala de dado e de treino — que custa tempo e GPU, não invenção.


O acervo

Toda fonte entra com licença declarada e uso comercial permitido. Nada de copyleft, nada sem licença, nada gerado por outro modelo de linguagem.

Corpus do lab-150m · 1º de agosto de 2026
FonteLicença DocumentosTokens
Querido Diário — diários oficiais municipaisdomínio público87.1651.500.753.508
Project Gutenberg — inglêsdomínio público6.0001.004.249.140
Internet Archive — espanholdomínio público4.384817.989.537
Código-fonte de licença permissivaMIT / Apache / BSD80.000186.622.288
Diário Oficial da Uniãodomínio público315.240152.523.812
Project Gutenberg — espanholdomínio público909104.578.684
Internet Archive — portuguêsdomínio público48857.012.113
Project Gutenberg — portuguêsdomínio público71246.381.538
Internet Archive — inglêsdomínio público4.00040.784.134
Discursos da Câmara dos Deputadosdomínio público64.18536.764.496
Electronic Journal of Differential EquationsCC-BY1.63724.602.746
OpenStax — livros didáticosCC-BY4.47219.049.873
Instruções humanas (OASST, Aya)Apache-2.024.0779.618.808
Wikidata — descrições em portuguêsCC0162.1917.829.983
14 fontes755.4604.008.760.660
Parâmetros
154.622.976
Camadas
11dimensão 1024
Vocabulário
32.000tokenizador próprio
Janela
2.048tokens
Perda de validação
1,9240após pós-treino
Onde roda
CPU8 núcleos, bfloat16