TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
# 有時候我覺得生活缺乏刺激的原因,是因為害怕被刺激,於是選擇逃避。 今天進城,城內風光明湄,人文薈萃,我這城外的土包子卻有些不習慣。 公館金石堂,結帳的時候遇到 鄭有傑 ,我向來認人的能力還可以,我對他的印象也只有兩部偶像劇的演出,但回家後查了一些 資料 ,才知道原來「 他們在畢業的前一天爆炸 」是他所編導的電視劇,我的腦子來了個 360 度的翻轉,真的開始認真找起他的作品。 # 白目與白痴,在某一個瞬間其實也沒什麼分別。 回到城外大約五點多,回到家體力不足的情況下,開了紗門看到光,竟然完全沒了睡意。抓了包包騎車出去,追著光到消逝的那一點之前,些許滿足的騎車到沖印店,很白目的拿了一支完全沒拍的底片給店員沖,結果當然是一條白片。 拿著白片,真正扼腕的倒不是白花掉的沖片費和一支底片,擔心的是相機會不會又有問題,然而最後可喜的是,查明原因後的結論是我的腦子有問題,至少是最不讓人擔心的了,因為那是個已知的問題。 # 常常對外宣稱自己在累積,卻不太清楚究竟在累積什麼。 在關渡碼頭的時候,一位阿伯和一位帶了 120 相機架了腳架拍光的帥哥,聊了好久的時間,老伯細訴著測光、構圖、動態範圍、你怎麼沒帶黑卡等等的言論,雖然沒太仔細聽,但應該也是個玩家。我總是在想,我們是玩過了這一遭,但硬要說累積了什麼會不會又太牽強。 我分明只累積了空的底片筒,然後在每次我女兒想玩的時候送給她看她開心不已的樣子而滿足,這算哪一招? 「追逐風,追逐太陽,在人生的大道上。」什麼才是人生的大道?