carregando o modelo…
Nenhum peso herdado. O corpus, o tokenizador, o treino e o pós-treino são nossos, e a procedência de cada fonte está aberta abaixo — fonte por fonte, licença por licença. É a única parte deste projeto que já está pronta, e é de propósito que ela venha primeiro.
Onde o projeto está
O lab-150m foi treinado do zero e responde: forma correta, português bem construído, fatos inventados. Ele não está aberto ao público porque não seria honesto chamar aquilo de assistente. Duas medidas explicam tudo, e nenhuma delas é surpresa depois de medida.
| Medida | lab-150m | Referência | O que significa |
|---|---|---|---|
| Tokens por parâmetro | 19 | 14.800 | O SmolLM2-135M é menor que o nosso e leu 2 trilhões de tokens. Dimensionamos pelo ótimo de Chinchilla, que é ótimo para o custo de treino — não para um modelo utilizável. |
| Português não-administrativo | 6,2% | — | 93,8% do português que ele leu é diário oficial, DOU e discurso de plenário. Ele nunca viu, em português, uma frase que explique o que uma coisa é. |
| Instruções em português | 440 | 24.077 | O pós-treino é 98% inglês e espanhol. Ele aprendeu a responder; não aprendeu em que língua. |
O que vem agora, nesta ordem: prosa expositiva no corpus em todas as línguas que o modelo fala, treino muito além do ponto de Chinchilla, e pós-treino equilibrado entre elas. O modelo volta para esta página quando sustentar uma resposta.
O que já está provado. A linha inteira de produção funciona, do texto bruto ao modelo respondendo: coleta com licença verificada por item, deduplicação, tokenizador próprio, decoder escrito do zero, pré-treino e pós-treino supervisionado. Nenhum peso herdado de ninguém. O que falta é escala de dado e de treino — que custa tempo e GPU, não invenção.
Toda fonte entra com licença declarada e uso comercial permitido. Nada de copyleft, nada sem licença, nada gerado por outro modelo de linguagem.
| Fonte | Licença | Documentos | Tokens |
|---|---|---|---|
| Querido Diário — diários oficiais municipais | domínio público | 87.165 | 1.500.753.508 |
| Project Gutenberg — inglês | domínio público | 6.000 | 1.004.249.140 |
| Internet Archive — espanhol | domínio público | 4.384 | 817.989.537 |
| Código-fonte de licença permissiva | MIT / Apache / BSD | 80.000 | 186.622.288 |
| Diário Oficial da União | domínio público | 315.240 | 152.523.812 |
| Project Gutenberg — espanhol | domínio público | 909 | 104.578.684 |
| Internet Archive — português | domínio público | 488 | 57.012.113 |
| Project Gutenberg — português | domínio público | 712 | 46.381.538 |
| Internet Archive — inglês | domínio público | 4.000 | 40.784.134 |
| Discursos da Câmara dos Deputados | domínio público | 64.185 | 36.764.496 |
| Electronic Journal of Differential Equations | CC-BY | 1.637 | 24.602.746 |
| OpenStax — livros didáticos | CC-BY | 4.472 | 19.049.873 |
| Instruções humanas (OASST, Aya) | Apache-2.0 | 24.077 | 9.618.808 |
| Wikidata — descrições em português | CC0 | 162.191 | 7.829.983 |
| 14 fontes | 755.460 | 4.008.760.660 | |