跳到主要內容

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

[底片集] 廢墟.Konica Autoreflex T3 卷一卷二

使用相機:Konica Autoreflex T3
使用底片:Kodak PJ400 過期
沖掃店家:士林正典

修好測光的 T3 回來之後,剛好去跑了一趟廢墟,手邊又只剩 PJ400 這支過期十幾年的老底片,最近測試這支 PJ400,覺得差不多老到要用 ISO 100-120 去拍了吧。拍了之後才發現相機還有漏光的問題,之後可能還要再檢測檢測。

跟徐凱麗去廢墟約會的時候,他很好心的借我他的 Konica AR Hexanon 35 f2 拍了快一卷,等到我拍完一卷之後才又急沖沖的拿回去,其實他很愛他的每一支鏡頭但還是願意借我,很感人。

Konica AR Hexanon 35mm f2 拍的》

68540024
68540025
68540026 68540028
68540018
68540011 68540006

Konica AR Hexanon 57mm f1.4 拍的》

67850031 67850026
67850029
67850021 67850033

其他這兩卷照片:Konica Autoreflex T3 vol.1Konica Autoreflex T3 vol.2

留言

張貼留言

回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!