AI 模型精密規格數據庫 GGUF Q4_K_M · CUDA / VULKAN
Document Specification // 1.0 REV: 2026-08-22

Thor / Strix Halo 模型組

適用於 NVIDIA Jetson Thor / AMD Ryzen AI Max+ 395 —— 同一份 Q4_K_M 權重兩台通用,換機器只換 llama.cpp build。

核心組 17.09 GB · 11 檔 替代 6.99 GB · 9 檔 驗證狀態:20/20 已通過

1.1記憶體預算分析儀 Memory Budget Analyzer

SCALE: 128 GB
0GB32GB64GB 96GB128GB
Total Memory Projection
GB
權重(檔案實測) KV cache(理論值) 執行時開銷(估)
32K

權重是檔案實際 byte 數;KV 是 §5 同一套算式的理論值; 執行時開銷沒有理論值(每 process 的 CUDA context / buffer),~3 GB 為估值。 K3V3 檔位中不支援 TurboQuant 的五列(§6 ⛔)以 q8_0 計。

2.0核心組 Model File Manifest

每個網址都用 Range 抓過檔頭、解出 GGUF metadata 比對 architecture 與量化型別 —— 不只是 HTTP 200。

模型 (Name)檔案 / Repo大小 (Size) 檔頭實測 (Header)狀態 (Status)操作 (Actions)
gemma-4-E4B-it
主 LLM
google_gemma-4-E4B-it-Q4_K_M.gguf
bartowski/google_gemma-4-E4B-it-GGUF
5.41 GBgemma4
Q4_K_M
已驗證
gemma-4-E2B-it
router
google_gemma-4-E2B-it-Q4_K_M.gguf
bartowski/google_gemma-4-E2B-it-GGUF
3.46 GBgemma4
Q4_K_M
已驗證
Qwen3-ASR-1.7B
ASR(含 mmproj,兩個都要)
Qwen3-ASR-1.7B-Q4_K_M.gguf
foryoung365/Qwen3-ASR-1.7B-Q4_K_M-GGUF
1.28 GBqwen3vl
Q4_K_M
已驗證
Qwen3-ASR-1.7B
ASR(含 mmproj,兩個都要)
mmproj-Qwen3-ASR-1.7B-Q4_K_M.gguf
foryoung365/Qwen3-ASR-1.7B-Q4_K_M-GGUF
0.22 GBclip
Q4_K_M
已驗證
Qwen3.5-0.8B
小模型 / LoRA 宿主
Qwen3.5-0.8B-Q4_K_M.gguf
YrD715/Qwen3.5-0.8B-Q4_K_M
0.53 GBqwen35
Q4_K_M
已驗證
BGE-M3
記憶:embedding
bge-m3-q4_k_m.gguf
groonga/bge-m3-Q4_K_M-GGUF
0.44 GBbert
Q4_K_M
已驗證
MemSifter-4B
記憶:篩選 / 回憶
MemSifter-4B-Thinking.Q4_K_M.gguf
mradermacher/MemSifter-4B-Thinking-GGUF
2.72 GBqwen3
Q4_K_M
已驗證
Qwen3-VL-2B-Instruct
視覺(官方 GGUF,含 mmproj)
Qwen3VL-2B-Instruct-Q4_K_M.gguf
Qwen/Qwen3-VL-2B-Instruct-GGUF
1.11 GBqwen3vl
Q4_K_M
已驗證
Qwen3-VL-2B-Instruct
視覺(官方 GGUF,含 mmproj)
mmproj-Qwen3VL-2B-Instruct-Q8_0.gguf
Qwen/Qwen3-VL-2B-Instruct-GGUF
0.45 GBclip
Q8_0
已驗證
Qwen3-TTS-12Hz-1.7B-Base
TTS(ggml-org GGUF,含 mmproj)
Qwen3-TTS-12Hz-1.7B-Base-Q4_K_M.gguf
ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF
1.04 GBqwen3tts
Q4_K_M
已驗證
Qwen3-TTS-12Hz-1.7B-Base
TTS(ggml-org GGUF,含 mmproj)
mmproj-Qwen3-TTS-12Hz-1.7B-Base-Q8_0.gguf
ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF
0.45 GBclip
Q8_0
已驗證

3.0替代方案 Alternatives

Embedding 與 rerank 本來就小;換的是模型不是精度。配對盡量 同家 —— BGE-M3 配 bge-reranker-v2-m3,或 Qwen3-Embedding 配 Qwen3-Reranker; 跨家分數尺度不同,門檻要重調。

模型 (Name)檔案 / Repo大小 (Size) 檔頭實測 (Header)狀態 (Status)操作 (Actions)
Qwen3-VL-4B-Instruct
視覺 / 想換更強的視覺就用這顆
Qwen3-VL-4B-Instruct-Q4_K_M.gguf
unsloth/Qwen3-VL-4B-Instruct-GGUF
2.50 GBqwen3vl
Q4_K_M
已驗證
Qwen3-VL-Embedding-2B
embedding / **看得懂圖**的 embedding,同家
Qwen.Qwen3-VL-Embedding-2B.Q4_K_M.gguf
DevQuasar/Qwen.Qwen3-VL-Embedding-2B-GGUF
1.11 GBqwen3vl
Q4_K_M
已驗證
Qwen3-VL-Reranker-2B
rerank / **看得懂圖**的 reranker,配上面那顆
Qwen3-VL-Reranker-2B.Q4_K_M.gguf
mradermacher/Qwen3-VL-Reranker-2B-GGUF
1.11 GBqwen3vl
Q4_K_M
已驗證
Qwen3-Embedding-0.6B
embedding / MTEB 多語前段,1024 維
qwen3-embedding-0.6b-q4_k_m.gguf
enacimie/Qwen3-Embedding-0.6B-Q4_K_M-GGUF
0.40 GBqwen3
Q4_K_M
已驗證
embeddinggemma-300m
embedding / 最小的一顆,Matryoshka 可截維
embeddinggemma-300m-q4_k_m.gguf
sabafallah/embeddinggemma-300m-Q4_K_M-GGUF
0.24 GBgemma-embedding
Q4_K_M
已驗證
jina-embeddings-v3
embedding / 長文本 8K
jina-embeddings-v3-q4_k_m.gguf
sabafallah/jina-embeddings-v3-Q4_K_M-GGUF
0.41 GBjina-bert-v3
Q4_K_M
已驗證
bge-reranker-v2-m3
rerank / 跟 BGE-M3 同家,配一起最穩
bge-reranker-v2-m3-q4_k_m.gguf
puppyM/bge-reranker-v2-m3-Q4_K_M-GGUF
0.44 GBbert
Q4_K_M
已驗證
Qwen3-Reranker-0.6B
rerank / 跟 Qwen3-Embedding 同家
qwen3-reranker-0.6b-q4_k_m.gguf
dean2155/Qwen3-Reranker-0.6B-Q4_K_M-GGUF
0.40 GBqwen3
Q4_K_M
已驗證
mxbai-rerank-base-v2
rerank / 英文強,中文較弱
mxbai-rerank-base-v2-Q4_K_M.gguf
sinjab/mxbai-rerank-base-v2-Q4_K_M-GGUF
0.40 GBqwen2
Q4_K_M
已驗證

4.0下載 Acquisition

只用 curl 和 sha256sum,裸機可跑。每個檔下載後比對 sha256, 對不上就 exit 1;已存在且校驗過的跳過,中斷可續傳。

curl -fsSL https://models.daedalus.work/download.sh -o download.sh
chmod +x download.sh

./download.sh ./models          # 核心組
./download.sh ./models --alts   # 連替代方案

download.sh · manifest.json · verified.json

sha256 的來源不能跟隨轉址取。 huggingface.co/…/resolve/… 回 302,其 X-Linked-ETag 才是檔案的 sha256;跟過去之後 Xet CDN 回 200 帶的 etag 是另一個東西(內容定址雜湊),拿它當 checksum 會讓每一個檔都驗不過,而且錯得很像對的。本頁的值取自 302。

5.0KV cache 矩陣 KV Matrix

KV = 2 × n_kv_heads × head_dim × tokens × bytes/elem,逐層加總。滑窗層封頂在 window,線性注意力層不計。 幾何取自各模型 config.json。理論值,單位 GB。

KV 格式B/elemRuntime 4K8K16K32K64K128K256K
f162.0000both2.204.358.6617.2634.4868.91137.76
q8_01.0625llama.cpp1.172.314.609.1718.3236.6173.18
q5_10.6875llama.cpp0.761.502.985.9311.8523.6947.35
q4_10.6250llama.cpp0.691.362.715.4010.7721.5343.05
q4_00.5625llama.cpp0.621.222.444.869.7019.3838.74
TurboQuant k8v40.7500vLLM0.831.633.256.4712.9325.8451.66
TurboQuant 4bit_nc0.5000vLLM0.551.092.164.328.6217.2334.44
TurboQuant k3v4_nc0.4375vLLM0.480.951.893.787.5415.0730.13
TurboQuant K3V30.3750vLLM0.410.821.623.246.4612.9225.83

llama.cpp 的 --cache-type-k/v 最低到 4-bit,沒有 3-bit。TurboQuant 只在 vLLM (--kv-cache-dtype turboquant_*,需 0.20.2+), 且只吃 plain GQA,不支援 sliding-window 與 hybrid attention。

5.1K3V3 逐模型 Per-model

模型4K8K16K32K64K128K256K
MemSifter-4B0.1130.2260.4530.9061.8123.6247.248
Qwen3-VL-2B0.0880.1760.3520.7051.4092.8195.637
Qwen3-ASR-1.7B0.0880.1760.3520.7051.4092.8195.637
Qwen3-TTS talker0.0880.1760.3520.7051.4092.8195.637
gemma-4-E4B full 0.0110.0220.0440.0880.1760.3520.705
gemma-4-E4B 滑窗 0.0070.0070.0070.0070.0070.0070.007
gemma-4-E2B full 0.0060.0110.0220.0440.0880.1760.352
gemma-4-E2B 滑窗 0.0030.0030.0030.0030.0030.0030.003
Qwen3.5-0.8B 0.0090.0190.0380.0750.1510.3020.604
算術下限0.410.821.623.246.4612.9225.83

⛔ = TurboQuant 套不上(sliding-window 或 hybrid attention)。 可套的四顆合計 32K 3.02 GB、128K 12.08 GB;其餘退 q8_0 的總量是 32K 3.64 GB、128K 14.46 GB。

6.0理論解碼上限 Decode Ceiling

解碼是 memory-bound:上限 = 記憶體頻寬 ÷ 每 token 讀取的權重 bytes(單人、短上下文)。頻寬取規格值 —— Thor 為 273 GB/s、Ryzen AI Max+ 395 為 256 GB/s;權重 bytes 是上表的 實際檔案大小。忽略 KV 讀取與 計算,實際值必低於此;† 的 Gemma E 系列每 token 只讀部分權重 (MatFormer),實際上限反而更高。單位 tokens/s。

gemma-4-E4B-it 5.41 GB 權重
Jetson
51
Ryzen
47
gemma-4-E2B-it 3.46 GB 權重
Jetson
79
Ryzen
74
MemSifter-4B2.72 GB 權重
Jetson
101
Ryzen
94
Qwen3-VL-2B1.11 GB 權重
Jetson
247
Ryzen
231
Qwen3-ASR-1.7B1.28 GB 權重
Jetson
213
Ryzen
200
Qwen3-TTS-1.7B1.04 GB 權重
Jetson
264
Ryzen
247
Qwen3.5-0.8B0.53 GB 權重
Jetson
513
Ryzen
481

7.0總記憶體 Totals

Context權重KV q4_0 執行時總計 KV K3V3總計
8K17.091.22~321.30.9321.0
16K17.092.44~322.51.8321.9
32K17.094.86~324.93.6423.7
64K17.099.70~329.87.2427.3
128K17.0919.38~339.514.4634.6

K3V3 欄是可部署數字(⛔ 五列已退回 q8_0)。