flying101 commited on
Commit
dfb5f57
·
verified ·
1 Parent(s): d31763d

Add Hexagon v75 (Galaxy S24 / SM8650, soc 57) bundle

Browse files

W8 decode + fp16 prefill + W8 lmhead + fp16 embed. Plane A: PASS 6/6 on S24.

.gitattributes CHANGED
@@ -34,3 +34,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  v81/tokenizer.json filter=lfs diff=lfs merge=lfs -text
 
 
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  v81/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
+ v75/tokenizer.json filter=lfs diff=lfs merge=lfs -text
v75/qwen06_decn1k_w8.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bf5b001ede6b08880eaae081618eb120f76a0cad0ead6cbec15ff0b30d41cb3e
3
+ size 445235200
v75/qwen06_embed_f16.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:616f9374ddbaae3a033a0174557d502719154882e21e5d975ab5b58e0244459d
3
+ size 311164928
v75/qwen06_lmh_w8.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7a4ed98b229a6995675c8ff02358a211c4e2f6654e6b0680be7bd1c88f62183e
3
+ size 157859840
v75/qwen06_pf_f16.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:334332b2ff4263514b2cad6bdaefe64c4e12fe19559c2e8ef1ac3d63a07c7986
3
+ size 895619072
v75/qwen3-0.6b-1024final.json ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "schema_version": 1,
3
+ "_comment": "Standalone Qwen3-0.6B as a first-class native QHexRT LLM (NO Genie). Same architecture as InternVL3.5-1B's LLM backbone (16q/8kv, head_dim 128, QK-norm, standard 1D RoPE theta 1e6, tied lm-head), which is the proven 16-head materialized attention that runs COHERENTLY at MAXCTX=2048 on v79 (unlike Llama's 32-head). decode graph qwen06_dec (fp16, 2048) + NPU tied lm-head (qwen06_lmh = x@E.T) + host embed lookup, full-dim 1D RoPE, cmask, sliding-window KV ring, driven by the qwen3_generate host-op. Decode-over-prompt seed (no batched prefill yet).",
4
+ "model": {
5
+ "name": "qwen3-0.6b-1024final",
6
+ "family": "llm",
7
+ "dsp_arch": "v75",
8
+ "tokenizer_pre": "qwen2"
9
+ },
10
+ "params": {
11
+ "hidden": 1024,
12
+ "vocab": 151936,
13
+ "n_layers": 28,
14
+ "max_ctx": 1024,
15
+ "kv_dim": 1024,
16
+ "head_dim": 128,
17
+ "rope_theta": 1000000.0,
18
+ "eos_token_id": 151645
19
+ },
20
+ "artifacts": {
21
+ "contexts": {
22
+ "prefill": {
23
+ "bin": "qwen06_pf_f16.bin"
24
+ },
25
+ "decode": {
26
+ "bin": "qwen06_decn1k_w8.bin"
27
+ },
28
+ "lmhead": {
29
+ "bin": "qwen06_lmh_w8.bin"
30
+ }
31
+ },
32
+ "embed": "qwen06_embed_f16.bin",
33
+ "tokenizer": "tokenizer.json"
34
+ },
35
+ "plan": {
36
+ "steps": [
37
+ {
38
+ "host": "qwen3_generate",
39
+ "params": {
40
+ "prefill": "qwen06_pf_f16",
41
+ "decode": "qwen06_decn1k_w8",
42
+ "lmhead": "qwen06_lmh_w8",
43
+ "max_new": 64,
44
+ "neg": -50000
45
+ }
46
+ }
47
+ ]
48
+ }
49
+ }
v75/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
3
+ size 11422650