由 mlx-swift-lm 模型登錄表提供。
Scope
目前支援範圍
數量來自 Runtime 的能力登錄,不代表每個衍生 checkpoint 均已逐一實測。
仍需 checkpoint 具備相容 processor 與視覺權重。
不依賴同目錄 Hugging Face config.json。
本輪重新驗證:33 項程式回歸與固定題集
本次 Swift 測試共 33 項,其中 30 項通過、0 失敗,另 3 項需額外實體模型環境而略過; 4B、9B、27B 三組配對模型均完成原生 MLX、llama.cpp + GGUF 與三種 Fast GGUF 模式的固定 100 題、 生成速度、Fast GGUF 容量及程序 RAM 量測。
Runtime matrix
格式與 Runtime 比較
「MLX + GGUF」代表 Swift Runtime 解析 GGUF,並轉成 MLX 可執行的權重佈局。
| 能力 | 原生 MLX | MLX + GGUF | llama + GGUF |
|---|---|---|---|
| 主要權重格式 | Safetensors/MLX 量化 | GGUF,載入時映射或轉換 | GGUF 原生執行 |
| 模型架構範圍 | 最廣 MLX 範圍 | 12 種已登錄 GGUF 架構 | 依內附 llama.cpp 版本 |
| 多模態 | VLM checkpoint 與 processor | 限已實作架構與配對 mmproj | 限 llama.cpp 支援的 mmproj |
| MMap | 目前尚未支援 | 可用;需視 tensor 是否必須轉換 | 可用;由 llama.cpp 管理 |
| KV Cache Q4/Q8 | 支援 | 支援 | 支援 |
| fastGGUF | 不適用 | 支援;需模型級品質驗證 | 不適用 |
| DFlash | Qwen3/Qwen3.5,需配對 MLX Draft | GGUF Target 不啟用 | 需配對 DFlash Draft GGUF |
| 失敗診斷 | 設定/processor/權重驗證 | 架構、量化、映射、形狀逐層驗證 | llama.cpp 啟動與模型日誌 |
MLX GGUF
GGUF 架構相容性
專屬路徑會處理該架構特有的設定、norm、tokenizer 或逐層參數。
| 架構 | 合成策略 | 文字模型 | 多模態備註 | 驗證狀態 |
|---|---|---|---|---|
| Apertus | 專屬;逐層 xIELU | 支援 | 本報告只驗證文字輸出 | 70B 實機驗證 |
| Gemma | 通用文字設定 | 支援 | 依模型變體 | 載入時驗證 |
| Gemma 3 | 專屬;四組 norm、SentencePiece | 支援 | 文字 encoder 已驗證 | 12B 實機驗證 |
| Gemma 4 | 專屬;PLE、共享 K/V、逐層 FFN | 支援 | 需配對 mmproj 才能處理影像 | E2B/E4B 實機驗證 |
| Llama | 標準文字設定 | 支援 | 依配對 projector | 載入時驗證 |
| MiMo | 通用文字設定 | 支援 | 未宣告 | 載入時驗證 |
| MiniCPM | 通用文字設定 | 支援 | 視實際變體 | 載入時驗證 |
| Mistral | 通用文字設定 | 支援 | 視實際變體 | 載入時驗證 |
| Qwen 2 | 標準文字設定 | 支援 | 文字路徑 | 載入時驗證 |
| Qwen 3 | 標準文字設定 | 支援 | 文字路徑 | 載入時驗證 |
| Qwen 3.5 | 專屬;混合層與 tokenizer | 支援 | 可搭配相容 mmproj | 4B/9B/27B 實機驗證 |
| SmolLM 3 | 通用文字設定 | 支援 | 未宣告 | 載入時驗證 |
Tensor formats
GGUF tensor 支援
來源量化能否原樣保留,會直接影響磁碟占用、記憶體與數值差異。
浮點來源統一 BF16
F32、F16、BF16 tensor 會建立 BF16 運算權重;I8、I16、I32 則維持對應整數 tensor。
Q8 保留 INT8 角色
Q8_0 會轉成 MLX affine INT8;避免將 GGUF 中刻意保留較高精度的 tensor 無條件壓成 INT4。
Mode 1:均衡.預設
mode1 依 GGUF block metadata 沿用可表示的 K-Quant 來源 4-bit block;沿用 tensor 固定 group 32,其餘張量自動使用 group 64。
Mode 2:較高精度
mode2 將低位元來源重新量化為 MLX INT8,策略自動使用 group 64;浮點與小型參數仍依原有型別規則處理。
Mode 3:最快
mode3 將低位元來源重新量化為 MLX INT4,策略固定使用 group 32,不受外部 group size 設定覆寫。
Fast GGUF(.fgguf)
Fast GGUF 以分片容器放在原始 GGUF 同一目錄;每個 tensor 依收益選擇 LZFSE 無損壓縮或 raw MMap 對齊。格式不是標準 GGUF,可由「移除 Fast GGUF」獨立移除。
Physical validation
本機實測樣本
本輪五種模式結果依序為原生 MLX、llama.cpp + GGUF、Mode 1、Mode 2、Mode 3;可載入與輸出品質是不同驗證項目。
| 模型 | 格式 | 規模 | 驗證項目 | 結果 |
|---|---|---|---|---|
| Qwen 3.5 4B | MLX/GGUF Q4_0 | 4B | 五種模式,固定 100 題 | 68/100、73/100、72/100、72/100、70/98 |
| Ornith 1.5 9B | MLX/GGUF Q4_K_M | 9B | 五種模式,固定 100 題 | 78/99、78/100、78/100、78/100、77/100 |
| Qwen 3.8 27B | MLX/GGUF 混合量化 | 27B | 五種模式,固定 100 題 | 89/100、87/100、87/100、88/100、82/100 |
| Gemma 3 12B | GGUF | 12B | SentencePiece、norm、固定輸出 | 先前實機通過 |
| Gemma 4 E2B/E4B | GGUF | MoE | PLE、共享 K/V、FFN 版型 | 先前實機通過 |
| Apertus 1.5 70B | GGUF Q4_K_M | 70B | xIELU、MMap、chat EOS 停止 | 先前實機通過 |
Known boundaries
目前邊界與判定原則
Muse-Glimmer
GGUF 架構尚無對應的 mlx-swift-lm 模型實作;保留在「尚未測試」群組供手動嘗試,不宣告相容。
影音/擴散 GGUF
LTX Video、MiniMax H3 影音 checkpoint 與獨立 T5 encoder 並非文字 LLM,不會因副檔名為 GGUF 就列入文字模型名單。
MMap 不是硬性記憶體上限
使用 MMap 技術降低 RAM 用量,原生 MLX 目前尚未支援;需要重新量化的 tensor 仍可能產生常駐 MLX 權重。
衍生 checkpoint 必須重新驗證
即使 model_type 相同,新增 expert、processor 或非標準 tensor 名稱仍可能需要新的通用映射。
可生成不代表品質可用
本輪策略均能載入並完成生成,但速度、資源與固定題集結果不同;相容性紀錄必須同時保留執行狀態與數值品質。