Etamus commited on
Commit
3eb61f9
·
verified ·
1 Parent(s): a0aa061

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +81 -0
README.md CHANGED
@@ -1,3 +1,84 @@
1
  ---
 
2
  license: apache-2.0
 
 
 
 
 
 
 
3
  ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  ---
2
+ library_name: transformers
3
  license: apache-2.0
4
+ license_link: https://ai.google.dev/gemma/docs/gemma_4_license
5
+ pipeline_tag: image-text-to-text
6
+ base_model: google/gemma-4-12B-it-qat-q4_0-unquantized
7
+ tags:
8
+ - NeveAI
9
+ - Neve
10
+ - Echo
11
  ---
12
+
13
+ <div align="center">
14
+ <img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/uEgq1cKh6eWYsyWKbcqch.png" width="50%">
15
+ </div>
16
+
17
+ <h1 align="center">Neve-Echo-6-12B-QAT-GGUF</h1>
18
+
19
+ <div align="center">
20
+ <a href="https://github.com/NeveIA">
21
+ <img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/KQa7-ajynUAhTS-kxNtYT.png" width="20%" alt="NeveAI GitHub">
22
+ </a>
23
+ </div>
24
+
25
+ ---
26
+
27
+ > [!Note]
28
+ > Este model card é para as novas versões da família Neve Echo otimizadas com Treinamento Consciente de Quantização (QAT), que permite preservar uma qualidade semelhante à bfloat16 enquanto reduz drasticamente os requisitos de memória para carregar o modelo.
29
+ > Quatro versões dos checkpoints QAT estão disponíveis:
30
+ > * **Checkpoints QAT não quantizados** (Q4_0): Pesos de meia precisão extraídos do pipeline QAT, ideais para compilação downstream personalizada e pesquisa.
31
+ > * **GGUF** (Q4_0): Formatos prontos para implantação, com ampla compatibilidade no ecossistema.
32
+ > * **Otimizado para dispositivos móveis** (wNa8o8): Um esquema personalizado projetado explicitamente para eficiência em hardware móvel. Ele apresenta camadas de decodificação direcionadas de 2 bits, caches KV otimizados e ativações estáticas para maximizar a economia de VRAM.
33
+ > * **Tensores Comprimidos** (w4a16): Checkpoints QAT serializados no formato compressed-tensors para inferência nativa e otimizada com vLLM.
34
+
35
+ ---
36
+
37
+ ## Introdução
38
+
39
+ O **Neve Echo 6** é um modelo de linguagem de última geração focado em **uso geral e raciocínio para tarefas variadas**. Esta versão em formato GGUF foi otimizada pela NeveAI para oferecer o equilíbrio ideal entre precisão lógica e eficiência computacional.
40
+
41
+ ---
42
+
43
+ ## Destaques do Modelo
44
+
45
+ Este modelo foi desenvolvido para uso geral e execução de tarefas diversas, focando em:
46
+
47
+ * **Raciocínio Avançado (Thinking):** Projetado como um modelo altamente capaz de raciocínio, com suporte a modos de pensamento estruturado para tarefas complexas.
48
+ * **Uso Geral e Produtividade:** Otimizado para uma ampla variedade de tarefas como geração de texto, assistência, explicações, planejamento e automação.
49
+ * **Multimodalidade (Texto + Imagem):** Capaz de processar entradas multimodais com suporte a diferentes resoluções e proporções.
50
+ * **Tool Calling e System Prompt:** Suporte nativo a chamadas de função e ao papel `system`, permitindo maior controle e integração com ferramentas externas.
51
+
52
+ ## Benchmark de Performance
53
+
54
+ O Neve Echo 6 demonstra desempenho alinhado a modelos de ponta em múltiplas categorias:
55
+
56
+ | Categoria | Benchmark | Neve Echo 6 | Gemma 4 26B A4B |
57
+ | :--- | :--- | :---: | :---: |
58
+ | **Knowledge** | MMLU Pro | **77.2%** | 82.6% |
59
+ | **Reasoning** | GPQA Diamond | **78.8%** | 82.3% |
60
+ | **Math** | AIME 2026 | **77.5%** | 88.3% |
61
+ | **General** | BigBench Extra Hard | **53.0%** | 64.8% |
62
+
63
+ ---
64
+
65
+ ## Detalhes da Arquitetura
66
+
67
+ - **Arquitetura:** Transformer otimizado para raciocínio e tarefas gerais.
68
+ - **Parâmetros:** ~12B totais (com subset ativo por token para eficiência).
69
+ - **Janela de Contexto:** Até 256K tokens.
70
+ - **Camadas:** Arquitetura profunda com atenção global na camada final.
71
+ - **MoE:** Roteamento dinâmico de experts (subset ativo por inferência), otimizando performance e uso de memória.
72
+
73
+ ## Como utilizar (GGUF)
74
+
75
+ Este modelo é compatível com `llama.cpp`, `Ollama`, `LM Studio` e outras ferramentas que suportam o formato GGUF.
76
+ Foco direcionado ao uso do modelo na plataforma autoral da organização [NeveAI](https://github.com/Etamus/NeveAI)
77
+
78
+ ## Licença
79
+
80
+ Este repositório e os pesos do modelo estão licenciados sob a [Licença Apache 2.0](LICENSE).
81
+
82
+ ## Contato
83
+
84
+ Se tiver qualquer dúvida, por favor, levante um issue ou entre em contato conosco em [NeveIA](https://github.com/NeveIA).