Thor / Strix Halo 模型組
適用於 NVIDIA Jetson Thor / AMD Ryzen AI Max+ 395 —— 同一份 Q4_K_M 權重兩台通用,換機器只換 llama.cpp build。
1.1記憶體預算分析儀 Memory Budget Analyzer
SCALE: 128 GB權重是檔案實際 byte 數;KV 是 §5 同一套算式的理論值; 執行時開銷沒有理論值(每 process 的 CUDA context / buffer),~3 GB 為估值。 K3V3 檔位中不支援 TurboQuant 的五列(§6 ⛔)以 q8_0 計。
2.0核心組 Model File Manifest
每個網址都用 Range 抓過檔頭、解出 GGUF metadata 比對 architecture 與量化型別 —— 不只是 HTTP 200。
| 模型 (Name) | 檔案 / Repo | 大小 (Size) | 檔頭實測 (Header) | 狀態 (Status) | 操作 (Actions) |
|---|---|---|---|---|---|
| gemma-4-E4B-it 主 LLM | google_gemma-4-E4B-it-Q4_K_M.gguf bartowski/google_gemma-4-E4B-it-GGUF | 5.41 GB | gemma4 Q4_K_M | 已驗證 | |
| gemma-4-E2B-it router | google_gemma-4-E2B-it-Q4_K_M.gguf bartowski/google_gemma-4-E2B-it-GGUF | 3.46 GB | gemma4 Q4_K_M | 已驗證 | |
| Qwen3-ASR-1.7B ASR(含 mmproj,兩個都要) | Qwen3-ASR-1.7B-Q4_K_M.gguf foryoung365/Qwen3-ASR-1.7B-Q4_K_M-GGUF | 1.28 GB | qwen3vl Q4_K_M | 已驗證 | |
| Qwen3-ASR-1.7B ASR(含 mmproj,兩個都要) | mmproj-Qwen3-ASR-1.7B-Q4_K_M.gguf foryoung365/Qwen3-ASR-1.7B-Q4_K_M-GGUF | 0.22 GB | clip Q4_K_M | 已驗證 | |
| Qwen3.5-0.8B 小模型 / LoRA 宿主 | Qwen3.5-0.8B-Q4_K_M.gguf YrD715/Qwen3.5-0.8B-Q4_K_M | 0.53 GB | qwen35 Q4_K_M | 已驗證 | |
| BGE-M3 記憶:embedding | bge-m3-q4_k_m.gguf groonga/bge-m3-Q4_K_M-GGUF | 0.44 GB | bert Q4_K_M | 已驗證 | |
| MemSifter-4B 記憶:篩選 / 回憶 | MemSifter-4B-Thinking.Q4_K_M.gguf mradermacher/MemSifter-4B-Thinking-GGUF | 2.72 GB | qwen3 Q4_K_M | 已驗證 | |
| Qwen3-VL-2B-Instruct 視覺(官方 GGUF,含 mmproj) | Qwen3VL-2B-Instruct-Q4_K_M.gguf Qwen/Qwen3-VL-2B-Instruct-GGUF | 1.11 GB | qwen3vl Q4_K_M | 已驗證 | |
| Qwen3-VL-2B-Instruct 視覺(官方 GGUF,含 mmproj) | mmproj-Qwen3VL-2B-Instruct-Q8_0.gguf Qwen/Qwen3-VL-2B-Instruct-GGUF | 0.45 GB | clip Q8_0 | 已驗證 | |
| Qwen3-TTS-12Hz-1.7B-Base TTS(ggml-org GGUF,含 mmproj) | Qwen3-TTS-12Hz-1.7B-Base-Q4_K_M.gguf ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF | 1.04 GB | qwen3tts Q4_K_M | 已驗證 | |
| Qwen3-TTS-12Hz-1.7B-Base TTS(ggml-org GGUF,含 mmproj) | mmproj-Qwen3-TTS-12Hz-1.7B-Base-Q8_0.gguf ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF | 0.45 GB | clip Q8_0 | 已驗證 |
3.0替代方案 Alternatives
Embedding 與 rerank 本來就小;換的是模型不是精度。配對盡量 同家 —— BGE-M3 配 bge-reranker-v2-m3,或 Qwen3-Embedding 配 Qwen3-Reranker; 跨家分數尺度不同,門檻要重調。
| 模型 (Name) | 檔案 / Repo | 大小 (Size) | 檔頭實測 (Header) | 狀態 (Status) | 操作 (Actions) |
|---|---|---|---|---|---|
| Qwen3-VL-4B-Instruct 視覺 / 想換更強的視覺就用這顆 | Qwen3-VL-4B-Instruct-Q4_K_M.gguf unsloth/Qwen3-VL-4B-Instruct-GGUF | 2.50 GB | qwen3vl Q4_K_M | 已驗證 | |
| Qwen3-VL-Embedding-2B embedding / **看得懂圖**的 embedding,同家 | Qwen.Qwen3-VL-Embedding-2B.Q4_K_M.gguf DevQuasar/Qwen.Qwen3-VL-Embedding-2B-GGUF | 1.11 GB | qwen3vl Q4_K_M | 已驗證 | |
| Qwen3-VL-Reranker-2B rerank / **看得懂圖**的 reranker,配上面那顆 | Qwen3-VL-Reranker-2B.Q4_K_M.gguf mradermacher/Qwen3-VL-Reranker-2B-GGUF | 1.11 GB | qwen3vl Q4_K_M | 已驗證 | |
| Qwen3-Embedding-0.6B embedding / MTEB 多語前段,1024 維 | qwen3-embedding-0.6b-q4_k_m.gguf enacimie/Qwen3-Embedding-0.6B-Q4_K_M-GGUF | 0.40 GB | qwen3 Q4_K_M | 已驗證 | |
| embeddinggemma-300m embedding / 最小的一顆,Matryoshka 可截維 | embeddinggemma-300m-q4_k_m.gguf sabafallah/embeddinggemma-300m-Q4_K_M-GGUF | 0.24 GB | gemma-embedding Q4_K_M | 已驗證 | |
| jina-embeddings-v3 embedding / 長文本 8K | jina-embeddings-v3-q4_k_m.gguf sabafallah/jina-embeddings-v3-Q4_K_M-GGUF | 0.41 GB | jina-bert-v3 Q4_K_M | 已驗證 | |
| bge-reranker-v2-m3 rerank / 跟 BGE-M3 同家,配一起最穩 | bge-reranker-v2-m3-q4_k_m.gguf puppyM/bge-reranker-v2-m3-Q4_K_M-GGUF | 0.44 GB | bert Q4_K_M | 已驗證 | |
| Qwen3-Reranker-0.6B rerank / 跟 Qwen3-Embedding 同家 | qwen3-reranker-0.6b-q4_k_m.gguf dean2155/Qwen3-Reranker-0.6B-Q4_K_M-GGUF | 0.40 GB | qwen3 Q4_K_M | 已驗證 | |
| mxbai-rerank-base-v2 rerank / 英文強,中文較弱 | mxbai-rerank-base-v2-Q4_K_M.gguf sinjab/mxbai-rerank-base-v2-Q4_K_M-GGUF | 0.40 GB | qwen2 Q4_K_M | 已驗證 |
4.0下載 Acquisition
只用 curl 和 sha256sum,裸機可跑。每個檔下載後比對 sha256, 對不上就 exit 1;已存在且校驗過的跳過,中斷可續傳。
curl -fsSL https://models.daedalus.work/download.sh -o download.sh chmod +x download.sh ./download.sh ./models # 核心組 ./download.sh ./models --alts # 連替代方案
download.sh · manifest.json · verified.json
5.0KV cache 矩陣 KV Matrix
KV = 2 × n_kv_heads × head_dim × tokens × bytes/elem,逐層加總。滑窗層封頂在 window,線性注意力層不計。 幾何取自各模型 config.json。理論值,單位 GB。
| KV 格式 | B/elem | Runtime | 4K | 8K | 16K | 32K | 64K | 128K | 256K |
|---|---|---|---|---|---|---|---|---|---|
| f16 | 2.0000 | both | 2.20 | 4.35 | 8.66 | 17.26 | 34.48 | 68.91 | 137.76 |
| q8_0 | 1.0625 | llama.cpp | 1.17 | 2.31 | 4.60 | 9.17 | 18.32 | 36.61 | 73.18 |
| q5_1 | 0.6875 | llama.cpp | 0.76 | 1.50 | 2.98 | 5.93 | 11.85 | 23.69 | 47.35 |
| q4_1 | 0.6250 | llama.cpp | 0.69 | 1.36 | 2.71 | 5.40 | 10.77 | 21.53 | 43.05 |
| q4_0 | 0.5625 | llama.cpp | 0.62 | 1.22 | 2.44 | 4.86 | 9.70 | 19.38 | 38.74 |
| TurboQuant k8v4 | 0.7500 | vLLM | 0.83 | 1.63 | 3.25 | 6.47 | 12.93 | 25.84 | 51.66 |
| TurboQuant 4bit_nc | 0.5000 | vLLM | 0.55 | 1.09 | 2.16 | 4.32 | 8.62 | 17.23 | 34.44 |
| TurboQuant k3v4_nc | 0.4375 | vLLM | 0.48 | 0.95 | 1.89 | 3.78 | 7.54 | 15.07 | 30.13 |
| TurboQuant K3V3 | 0.3750 | vLLM | 0.41 | 0.82 | 1.62 | 3.24 | 6.46 | 12.92 | 25.83 |
llama.cpp 的 --cache-type-k/v 最低到 4-bit,沒有 3-bit。TurboQuant 只在 vLLM (--kv-cache-dtype turboquant_*,需 0.20.2+), 且只吃 plain GQA,不支援 sliding-window 與 hybrid attention。
5.1K3V3 逐模型 Per-model
| 模型 | 4K | 8K | 16K | 32K | 64K | 128K | 256K |
|---|---|---|---|---|---|---|---|
| MemSifter-4B | 0.113 | 0.226 | 0.453 | 0.906 | 1.812 | 3.624 | 7.248 |
| Qwen3-VL-2B | 0.088 | 0.176 | 0.352 | 0.705 | 1.409 | 2.819 | 5.637 |
| Qwen3-ASR-1.7B | 0.088 | 0.176 | 0.352 | 0.705 | 1.409 | 2.819 | 5.637 |
| Qwen3-TTS talker | 0.088 | 0.176 | 0.352 | 0.705 | 1.409 | 2.819 | 5.637 |
| gemma-4-E4B full ⛔ | 0.011 | 0.022 | 0.044 | 0.088 | 0.176 | 0.352 | 0.705 |
| gemma-4-E4B 滑窗 ⛔ | 0.007 | 0.007 | 0.007 | 0.007 | 0.007 | 0.007 | 0.007 |
| gemma-4-E2B full ⛔ | 0.006 | 0.011 | 0.022 | 0.044 | 0.088 | 0.176 | 0.352 |
| gemma-4-E2B 滑窗 ⛔ | 0.003 | 0.003 | 0.003 | 0.003 | 0.003 | 0.003 | 0.003 |
| Qwen3.5-0.8B ⛔ | 0.009 | 0.019 | 0.038 | 0.075 | 0.151 | 0.302 | 0.604 |
| 算術下限 | 0.41 | 0.82 | 1.62 | 3.24 | 6.46 | 12.92 | 25.83 |
⛔ = TurboQuant 套不上(sliding-window 或 hybrid attention)。 可套的四顆合計 32K 3.02 GB、128K 12.08 GB;其餘退 q8_0 的總量是 32K 3.64 GB、128K 14.46 GB。
6.0理論解碼上限 Decode Ceiling
解碼是 memory-bound:上限 = 記憶體頻寬 ÷ 每 token 讀取的權重 bytes(單人、短上下文)。頻寬取規格值 —— Thor 為 273 GB/s、Ryzen AI Max+ 395 為 256 GB/s;權重 bytes 是上表的 實際檔案大小。忽略 KV 讀取與 計算,實際值必低於此;† 的 Gemma E 系列每 token 只讀部分權重 (MatFormer),實際上限反而更高。單位 tokens/s。
7.0總記憶體 Totals
| Context | 權重 | KV q4_0 | 執行時 | 總計 | KV K3V3 | 總計 |
|---|---|---|---|---|---|---|
| 8K | 17.09 | 1.22 | ~3 | 21.3 | 0.93 | 21.0 |
| 16K | 17.09 | 2.44 | ~3 | 22.5 | 1.83 | 21.9 |
| 32K | 17.09 | 4.86 | ~3 | 24.9 | 3.64 | 23.7 |
| 64K | 17.09 | 9.70 | ~3 | 29.8 | 7.24 | 27.3 |
| 128K | 17.09 | 19.38 | ~3 | 39.5 | 14.46 | 34.6 |
K3V3 欄是可部署數字(⛔ 五列已退回 q8_0)。