TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
使用相機: Konica Autoreflex T2 with AR 40mm f1.8 使用底片:KODAK PROFESSIONAL EKTAPRESS PJ400 過期,拍 200 正常沖 沖掃店家:公館五色鳥 上個禮拜六,因為馬麻上整天班,中午以後我帶 Angel 到四號公園去走走,免得她在家無聊。 快三歲的 Angel,現在會主動要求要拍照,並且愈來愈有擺 POSE 的想法。 照例會先到溜滑梯和搖搖馬的兒童遊樂區,玩一陣子。 Angel 那天也算蠻配合的,問她要不要去別的地方走走她也一副很樂意的樣子,平時要她離開兒童遊樂區還蠻不容易的,老爸有遵守承諾帶她出來玩還是有加到分的吧。 在籃球場停了一下,跟 Angel 一起看人打籃球。籃球場的一旁是一片草地,有幾個孩子正在商量他們自己的遊戲規則,我跟 Angel 經過時,一位哥哥很主動的跑過來招手,問 Angel 要不要跟他們一起玩,Angel 根本就忘記她的老爸,頭也不回的走過去跟他們認識起來。 他們正在討論怎麼玩這顆大球,遊戲開始前,在孩子們的要求之下,我拍了這張照片,照片中間那一位蹲得也太低了,大概和賭神一樣有著不入鏡的堅持吧。 接著他們煞有其事的分配角色,這位可愛的小姊姊正在說明遊戲規則,而 Angel 則被安排了一個助理裁判的角色。 我記得有一條規則是,如果這顆球在踢的過程碰到這兩位可愛的裁判,那麼踢球過來的那一方要扣五分。 是真的有在計分的。 這位球員得分之後,在對方還未破蛋的情況下,他舉手詢問了裁判一個問題:『如果對方現在踢球撞到裁判不是要扣五分嗎?可是他現在零分的話,是會變成幾分?』 裁判的回答是,零分。 這位比 Angel 大一點的小帥哥是什麼角色其實是沒什麼著墨的,我猜大概是球員兼裁判的身份吧,他有時會出現在球場的中央攔截正在行進中的球,後來卻是很長的時間都待在裁判區。 比賽後來變得很不激烈,算是單方面壓倒性的勝利,輸的那一方是有解釋其實他是個網球選手,合理的化解了足球慘敗的尷尬,他們後來真的找來網球和拍子又比起來,在我心目中這是兩位相當全面的運動選手。 在他們不踢足球之後,裁判區突然就完成了改組,也不用當裁判了,開始進行玩沙撿石的活動。 那天下午認識的這位可愛的小姊姊,很照顧 Angel...