TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
(Graflex Crown,Schneider Xenar 135mm f4.7,Fujifilm RDP III 4x5,番糬葛格沖,羅東阿正掃描) 今天早上跟 ApplePeel 蘋果皮哥哥通了電話,很開心,他真的很認真在看我寫的狗屁網誌耶,我都記不得自己寫過什麼,他竟然都知道好驚人。 拍照要用什麼器材的這件事,說是一個害一個也沒錯,雖是願者上勾,都有各自的好惡,但多繞幾圈其實大家都玩得差不多,早跟晚而已,很奇妙。 回頭說到玩 45 也是被一個台中的朋友害的,不過 Yuchen 害我的事蹟太多了,兩三年來大致上是從 Contax 開始,中間推一下 Topcon ,然後不知道為什麼跳過 120 沒 Follow 到,突然就來到 4x5。 我聽 Yuchen 的話都找便當機,已經算是出門輕便的了,還住台北的時候,大概是腦子爬袋了,有一次帶了兩台 135,一台 Mamiya Universal,一台 45 便當去住蘇澳民宿。那時我根本沒確認過那台 Busch 機身上的無限遠定位位置對不對,一直以為是正確的,也不會用對焦屏先確定一下,就這樣用那台殺了前四張全糊,爽爽的十分之四,拍壞一張燒 100 元真是天殺的浪漫,還好後來是因為找到 Busch 插拍立得片匣的解法,加上 PA-145 也到了,才終於知道原來賣家的定位點定得稍微前面了些。 然後因為第一台進到的 Graflex Crown RF 是壞的,只能用對焦屏拍,所以又搞了一支承重不錯的腳架;片匣我好像最多一次帶過五個,結果只拍一張或好像根本沒拍就再揹回來;45 底片可以沖的店家不多,黑白又沒空自己沖,也沒大罐子可以沖 45,而且照這樣看下去,之後可能也得要有自己準備高階一點的平台掃描器的打算。 麻煩事不少,把握度不高,但拍出來的東西,爽度真的蠻高。 (Graflex Crown,Rodenstock Sironar 100mm f5.6,Fujifilm RDP III 4x5,番糬葛格沖,羅東阿正掃描)