guifav commited on
Commit
7d210ba
·
verified ·
1 Parent(s): ee06a3f

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +5 -1
README.md CHANGED
@@ -18,7 +18,9 @@ tags:
18
 
19
  # Caramelo 4.4.1
20
 
21
- Modelo de IA brasileiro treinado por **Guilherme Favaron** sobre modelos open source. Esta versão usa como base o `google/gemma-4-E4B-it` (Gemma 4 E4B, Apache-2.0) e aplica um fine-tune LoRA que ensina a voz de escrita do autor: resposta direta em português do Brasil, argumento com dado e exemplo, sem hype e sem emoji.
 
 
22
 
23
  Em produção em [ia-caramelo.com](https://ia-caramelo.com) desde julho de 2026, servindo API compatível com a OpenAI, app web e CLI (`caramelo-chat` no npm). Gratuito, com limites de uso.
24
 
@@ -43,6 +45,8 @@ Nos 24 prompts held-out do benchmark do projeto:
43
 
44
  O 4.4.1 escreve respostas mais completas que o 3.4.2 (~400 vs ~270 tokens em média); no julgamento cego, os juízes apontaram que a versão anterior omitia conteúdo relevante com mais frequência.
45
 
 
 
46
  ## Produção
47
 
48
  Servido em CPU (llama.cpp, GGUF `Q4_K_M`, 5,0 GiB) a ~18,5 tokens/s em 4 vCPUs. O chat template do Gemma 4 liga thinking por padrão; em produção o servidor roda com `--reasoning off`. A persona e a camada de segurança são injetadas server-side pelo gateway e têm prioridade sobre instruções do usuário.
 
18
 
19
  # Caramelo 4.4.1
20
 
21
+ Modelo de IA brasileiro treinado por **Guilherme Favaron** sobre modelos open source. Esta versão usa como base o `google/gemma-4-E4B-it` (Gemma 4 E4B, Apache-2.0) e aplica um fine-tune LoRA que treina síntese e comunicação na voz de escrita do autor: resposta direta em português do Brasil, argumento com dado e exemplo, sem hype e sem emoji.
22
+
23
+ A premissa do projeto: a forma de comunicar é parte da performance. Nos testes cegos abaixo, o fine-tune vence o próprio modelo base em **qualidade**, além do estilo. No ciclo em que o raciocínio bruto foi medido (3.4.2, 1.432 questões do ENEM), ele ficou no nível do base.
24
 
25
  Em produção em [ia-caramelo.com](https://ia-caramelo.com) desde julho de 2026, servindo API compatível com a OpenAI, app web e CLI (`caramelo-chat` no npm). Gratuito, com limites de uso.
26
 
 
45
 
46
  O 4.4.1 escreve respostas mais completas que o 3.4.2 (~400 vs ~270 tokens em média); no julgamento cego, os juízes apontaram que a versão anterior omitia conteúdo relevante com mais frequência.
47
 
48
+ Esses números sustentam a premissa: treinar comunicação melhora a performance medida da tarefa. No ciclo anterior (3.4.2), o raciocínio bruto foi medido em 1.432 questões do ENEM e ficou no nível do base (57,5% vs 57,2%), enquanto a qualidade julgada às cegas venceu o base em 66–70%.
49
+
50
  ## Produção
51
 
52
  Servido em CPU (llama.cpp, GGUF `Q4_K_M`, 5,0 GiB) a ~18,5 tokens/s em 4 vCPUs. O chat template do Gemma 4 liga thinking por padrão; em produção o servidor roda com `--reasoning off`. A persona e a camada de segurança são injetadas server-side pelo gateway e têm prioridade sobre instruções do usuário.