Scope

目前支援範圍

數量來自 Runtime 的能力登錄,不代表每個衍生 checkpoint 均已逐一實測。

58 原生 MLX LLM 類型

由 mlx-swift-lm 模型登錄表提供。

18 原生 MLX VLM 類型

仍需 checkpoint 具備相容 processor 與視覺權重。

12 可合成設定的 GGUF 架構

不依賴同目錄 Hugging Face config.json

本輪重新驗證:33 項程式回歸與固定題集

本次 Swift 測試共 33 項,其中 30 項通過、0 失敗,另 3 項需額外實體模型環境而略過; 4B、9B、27B 三組配對模型均完成原生 MLX、llama.cpp + GGUF 與三種 Fast GGUF 模式的固定 100 題、 生成速度、Fast GGUF 容量及程序 RAM 量測。

Runtime matrix

格式與 Runtime 比較

「MLX + GGUF」代表 Swift Runtime 解析 GGUF,並轉成 MLX 可執行的權重佈局。

能力 原生 MLX MLX + GGUF llama + GGUF
主要權重格式 Safetensors/MLX 量化 GGUF,載入時映射或轉換 GGUF 原生執行
模型架構範圍 最廣 MLX 範圍 12 種已登錄 GGUF 架構 依內附 llama.cpp 版本
多模態 VLM checkpoint 與 processor 限已實作架構與配對 mmproj 限 llama.cpp 支援的 mmproj
MMap 目前尚未支援 可用;需視 tensor 是否必須轉換 可用;由 llama.cpp 管理
KV Cache Q4/Q8 支援 支援 支援
fastGGUF 不適用 支援;需模型級品質驗證 不適用
DFlash Qwen3/Qwen3.5,需配對 MLX Draft GGUF Target 不啟用 需配對 DFlash Draft GGUF
失敗診斷 設定/processor/權重驗證 架構、量化、映射、形狀逐層驗證 llama.cpp 啟動與模型日誌

MLX GGUF

GGUF 架構相容性

專屬路徑會處理該架構特有的設定、norm、tokenizer 或逐層參數。

架構 合成策略 文字模型 多模態備註 驗證狀態
Apertus專屬;逐層 xIELU支援本報告只驗證文字輸出70B 實機驗證
Gemma通用文字設定支援依模型變體載入時驗證
Gemma 3專屬;四組 norm、SentencePiece支援文字 encoder 已驗證12B 實機驗證
Gemma 4專屬;PLE、共享 K/V、逐層 FFN支援需配對 mmproj 才能處理影像E2B/E4B 實機驗證
Llama標準文字設定支援依配對 projector載入時驗證
MiMo通用文字設定支援未宣告載入時驗證
MiniCPM通用文字設定支援視實際變體載入時驗證
Mistral通用文字設定支援視實際變體載入時驗證
Qwen 2標準文字設定支援文字路徑載入時驗證
Qwen 3標準文字設定支援文字路徑載入時驗證
Qwen 3.5專屬;混合層與 tokenizer支援可搭配相容 mmproj4B/9B/27B 實機驗證
SmolLM 3通用文字設定支援未宣告載入時驗證

Tensor formats

GGUF tensor 支援

來源量化能否原樣保留,會直接影響磁碟占用、記憶體與數值差異。

浮點來源統一 BF16

F32、F16、BF16 tensor 會建立 BF16 運算權重;I8、I16、I32 則維持對應整數 tensor。

保留小型參數精度形狀仍須驗證

Q8 保留 INT8 角色

Q8_0 會轉成 MLX affine INT8;避免將 GGUF 中刻意保留較高精度的 tensor 無條件壓成 INT4。

INT8metadata 驅動

Mode 1:均衡.預設

mode1 依 GGUF block metadata 沿用可表示的 K-Quant 來源 4-bit block;沿用 tensor 固定 group 32,其餘張量自動使用 group 64。

預設模式source-aware

Mode 2:較高精度

mode2 將低位元來源重新量化為 MLX INT8,策略自動使用 group 64;浮點與小型參數仍依原有型別規則處理。

INT8group 64

Mode 3:最快

mode3 將低位元來源重新量化為 MLX INT4,策略固定使用 group 32,不受外部 group size 設定覆寫。

INT4group 32

Fast GGUF(.fgguf)

Fast GGUF 以分片容器放在原始 GGUF 同一目錄;每個 tensor 依收益選擇 LZFSE 無損壓縮或 raw MMap 對齊。格式不是標準 GGUF,可由「移除 Fast GGUF」獨立移除。

FGGUF 格式結構永久重用

Physical validation

本機實測樣本

本輪五種模式結果依序為原生 MLX、llama.cpp + GGUF、Mode 1、Mode 2、Mode 3;可載入與輸出品質是不同驗證項目。

模型格式規模驗證項目結果
Qwen 3.5 4BMLX/GGUF Q4_04B五種模式,固定 100 題68/100、73/100、72/100、72/100、70/98
Ornith 1.5 9BMLX/GGUF Q4_K_M9B五種模式,固定 100 題78/99、78/100、78/100、78/100、77/100
Qwen 3.8 27BMLX/GGUF 混合量化27B五種模式,固定 100 題89/100、87/100、87/100、88/100、82/100
Gemma 3 12BGGUF12BSentencePiece、norm、固定輸出先前實機通過
Gemma 4 E2B/E4BGGUFMoEPLE、共享 K/V、FFN 版型先前實機通過
Apertus 1.5 70BGGUF Q4_K_M70BxIELU、MMap、chat EOS 停止先前實機通過

Known boundaries

目前邊界與判定原則

Muse-Glimmer

GGUF 架構尚無對應的 mlx-swift-lm 模型實作;保留在「尚未測試」群組供手動嘗試,不宣告相容。

影音/擴散 GGUF

LTX Video、MiniMax H3 影音 checkpoint 與獨立 T5 encoder 並非文字 LLM,不會因副檔名為 GGUF 就列入文字模型名單。

MMap 不是硬性記憶體上限

使用 MMap 技術降低 RAM 用量,原生 MLX 目前尚未支援;需要重新量化的 tensor 仍可能產生常駐 MLX 權重。

衍生 checkpoint 必須重新驗證

即使 model_type 相同,新增 expert、processor 或非標準 tensor 名稱仍可能需要新的通用映射。

可生成不代表品質可用

本輪策略均能載入並完成生成,但速度、資源與固定題集結果不同;相容性紀錄必須同時保留執行狀態與數值品質。