File size: 4,099 Bytes
b7cfcfd
3eb61f9
b7cfcfd
3eb61f9
 
 
 
 
 
 
b7cfcfd
3eb61f9
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
ded5390
3eb61f9
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
---
library_name: transformers
license: apache-2.0
license_link: https://ai.google.dev/gemma/docs/gemma_4_license
pipeline_tag: image-text-to-text
base_model: google/gemma-4-12B-it-qat-q4_0-unquantized
tags:
  - NeveAI
  - Neve
  - Echo
---

<div align="center">
  <img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/uEgq1cKh6eWYsyWKbcqch.png" width="50%">
</div>

<h1 align="center">Neve-Echo-6-12B-QAT-GGUF</h1>

<div align="center">
  <a href="https://github.com/NeveIA">
    <img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/KQa7-ajynUAhTS-kxNtYT.png" width="20%" alt="NeveAI GitHub">
  </a>
</div>

---

> [!Note]
> Esse model card é para as novas versões da família Neve Echo otimizadas com Treinamento Consciente de Quantização (QAT), que permite preservar uma qualidade semelhante à bfloat16 enquanto reduz drasticamente os requisitos de memória para carregar o modelo.
> Quatro versões dos checkpoints QAT estão disponíveis:
> * **Checkpoints QAT não quantizados** (Q4_0): Pesos de meia precisão extraídos do pipeline QAT, ideais para compilação downstream personalizada e pesquisa.
> * **GGUF** (Q4_0): Formatos prontos para implantação, com ampla compatibilidade no ecossistema.
> * **Otimizado para dispositivos móveis** (wNa8o8): Um esquema personalizado projetado explicitamente para eficiência em hardware móvel. Ele apresenta camadas de decodificação direcionadas de 2 bits, caches KV otimizados e ativações estáticas para maximizar a economia de VRAM.
> * **Tensores Comprimidos** (w4a16): Checkpoints QAT serializados no formato compressed-tensors para inferência nativa e otimizada com vLLM.

---

## Introdução

O **Neve Echo 6** é um modelo de linguagem de última geração focado em **uso geral e raciocínio para tarefas variadas**. Esta versão em formato GGUF foi otimizada pela NeveAI para oferecer o equilíbrio ideal entre precisão lógica e eficiência computacional.

---

## Destaques do Modelo

Este modelo foi desenvolvido para uso geral e execução de tarefas diversas, focando em:

*   **Raciocínio Avançado (Thinking):** Projetado como um modelo altamente capaz de raciocínio, com suporte a modos de pensamento estruturado para tarefas complexas.
*   **Uso Geral e Produtividade:** Otimizado para uma ampla variedade de tarefas como geração de texto, assistência, explicações, planejamento e automação.
*   **Multimodalidade (Texto + Imagem):** Capaz de processar entradas multimodais com suporte a diferentes resoluções e proporções.
*   **Tool Calling e System Prompt:** Suporte nativo a chamadas de função e ao papel `system`, permitindo maior controle e integração com ferramentas externas.

## Benchmark de Performance

O Neve Echo 6 demonstra desempenho alinhado a modelos de ponta em múltiplas categorias:

| Categoria | Benchmark | Neve Echo 6 | Gemma 4 26B A4B |
| :--- | :--- | :---: | :---: |
| **Knowledge** | MMLU Pro | **77.2%** | 82.6% |
| **Reasoning** | GPQA Diamond | **78.8%** | 82.3% |
| **Math** | AIME 2026 | **77.5%** | 88.3% |
| **General** | BigBench Extra Hard | **53.0%** | 64.8% |

---

## Detalhes da Arquitetura

- **Arquitetura:** Transformer otimizado para raciocínio e tarefas gerais.
- **Parâmetros:** ~12B totais (com subset ativo por token para eficiência).
- **Janela de Contexto:** Até 256K tokens.
- **Camadas:** Arquitetura profunda com atenção global na camada final.
- **MoE:** Roteamento dinâmico de experts (subset ativo por inferência), otimizando performance e uso de memória.

## Como utilizar (GGUF)

Este modelo é compatível com `llama.cpp`, `Ollama`, `LM Studio` e outras ferramentas que suportam o formato GGUF. 
Foco direcionado ao uso do modelo na plataforma autoral da organização [NeveAI](https://github.com/Etamus/NeveAI)

## Licença

Este repositório e os pesos do modelo estão licenciados sob a [Licença Apache 2.0](LICENSE).

## Contato

Se tiver qualquer dúvida, por favor, levante um issue ou entre em contato conosco em [NeveIA](https://github.com/NeveIA).