TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
(Konica Autoreflex T2,Konica AR 40mm f1.8,Kodak PJ400 過期) 在進行 廢墟尾隨之旅 的前一個行程,卡文兄帶著我和八爺去金山財神廟朝聖,說這是他每半年都有的一個行程。 買金紙的時候,廟方的人員好像看得出我是第一次來,很貼心的跟我說最上面那張紅紙要去看旁邊桌子的範例怎麼填,照著填好,要蓋手印的時候,卡文兄突然拉住我的手,我以為他愛上我了,原來是要跟我說男左女右,我蓋錯手了;跟著去放金紙在供桌上的時候,也有很熱心的參拜民眾教我要怎麼擺金紙,還幫我檢查了上面那張紅色的紙有沒有寫,有沒有蓋手印,熱心的民眾還不只一個,我好害羞。 跟著卡文兄參拜完廟裡的神祇,接著可以跟五路財神申請一個財寶袋以及在財神銀行開戶跟財神借開運金,程序是這樣的: 財寶袋: 先手持一個聖筊,跟五路財神稟報姓名、住址、農曆的出生年月日與職業,三次擲筊的機會,有擲中一個聖杯即可獲賜一個財寶袋,接著左手持財寶袋順時針繞香爐三圈,功德箱隨喜。 開運金: 手持三個聖筊,跟五路財神稟報姓名、住址、農曆的出生年月日與職業,一次擲下三個聖筊,每得一個聖杯財神會借你開運金一百元,滿杯則是三百元。知道財神願意借多少開運金之後,再到旁邊的財神銀行櫃枱開戶。 財寶袋我是擲了第二次才得到,開運金則是獲得滿杯,這樣是說財神覺得我很窮所以要借我多一點來開運的意思嗎? 八爺是在參拜完沒多久就接到新案子的來電,我是 那幾顆之前掛很久沒賣掉的鏡頭 ,最近終於有人詢問並完成交易,雖然這些鏡頭是賠錢賣,但也總算是換回了現金,加上弱格這裡 很意外的在升上 PageRank 5 之後,多了一些收益,財神真的很幫忙,神通廣大來著。 金山財神廟 網站: https://www.mammon.tw/MammonTemple/ 地址:新北市萬里區磺潭村公館崙52之2號