可以檢查的測量結果。
固定工作負載
選擇一至三個模型。每個模型分開測試,關閉其伺服器後才啟動下一個;模型不會同時執行。程式使用各模型的 tokenizer 處理固定合成文字,再使用剛好 512 或 2,048 個輸入 token ID。每組工作產生 128 個 token,temperature 為 0、seed 為 42、忽略 EOS,並停用提示詞快取。捨棄一次暖機結果,保留三次正式測量。上下文為 4,096、KV 快取為 f16、關閉 flash attention、batch 及 microbatch 為 512、單一 slot、請求 GPU 層數為 999,CPU 執行緒數等於偵測到的邏輯核心數。
並行 jobs
TokFire Bench 亦提供獨立並行測試:同一 GGUF 或 MLX 模型,免費可同時執行 1–3 個工作,Pro 最多 20 個。測量三輪同步請求,分別報告每個工作的延遲與速度,以及總吞吐量。結果不會混入依序執行的標準測試。
Windows 預覽版
Windows 10/11 x64 使用 llama.cpp 及 GGUF,輸入 512 個 token、輸出 128 個 token,暖機後進行三輪同步測量。每個工作共用同一模型伺服器,每個 slot 配置 4,096 個上下文 token。報告使用 local-ai-windows-jobs-v1,包含 CPU、機型、GPU 名稱、RAM 及 Windows 版本,與 Mac 標準比較表分開儲存。GPU 名稱不代表已成功啟用 GPU 加速。Windows 執行檔尚未簽署,已在 macOS 交叉編譯及通過單元測試;Windows 介面、登入、取消及 CPU/GPU 推論測試仍待完成。
簡短試跑
可選的 MiniCPM 試跑使用單一模型、512 個輸入及 32 個輸出 token,進行一次暖機及一次測量。命令列試跑的 local-ai-trial-v1 報告保留在本機,不會進入標準比較資料庫。
測量項目
TTFT 是從開始本機 HTTP 請求到收到首個生成 token ID 的用戶端實際經過時間,包含本機 HTTP 開銷。預填充及生成速度來自執行環境最後的計時報告。載入時間由啟動程序至伺服器就緒,不會清除作業系統檔案快取。每個模型工作階段每 250 毫秒抽樣程序 RSS 峰值;這不是全部統一記憶體或 Metal 記憶體用量。
比較規則
模型檔案及執行環境二進位檔案均以 SHA-256 計算雜湊值。比較組別亦包含所有執行設定、規格版本及輸入/輸出長度。不同硬件與作業系統組合分列顯示。每份報告取三次測量的中位數,社群列再計算這些中位數的平均值。不會產生總分、品質分數、預測速度或已驗證標章。
已知限制
這些是社群提交資料,並非經認證的測量。格式驗證無法證明硬件資料真實,或防止修改過的用戶端。目前尚未測量功耗、溫度、swap、實際 GPU 層卸載驗證、全部 GPU 記憶體或持續散熱表現。模型載入時間受作業系統快取影響。忽略 EOS 是吞吐量測試,不是品質評估。請勿僅憑速度推論回答品質或廣泛的應用相容性。
私隱與公開分享
測試程式只向本機發出推論請求,並將報告儲存於本機。可選的 MiniCPM 啟動程式會從 Hugging Face 下載官方模型並驗證校驗碼。在瀏覽器匯入不會上傳。儲存需要明確同意收集及登入;公開是獨立的自願選項。帳戶 ID 私人保留,以管理擁有權及刪除。公開比較包含硬件及雜湊值,但不包含身分。網站訪客可查看公開比較;私人報告只限上傳該報告的帳戶存取。
桌面程式測試狀態
原始碼包含 SwiftUI macOS 介面及真正的 llama-server 測試程式。Python 通訊協定測試已在開發環境執行。Swift 編譯、實際 Metal 推論、介面生命週期測試及臨時簽署已在 M2 Max 通過。開發版 DMG 尚未經 Developer ID 簽署或 Apple 公證。
執行環境 API 參考:llama.cpp server