TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
使用相機:Mamiya C3 Professional with Mamiya-Sekor 55mm f4.5
使用底片:Kodak Ektacolor PRO 160
沖掃店家:士林正典
禮拜六下午,本來是要去關渡碼頭的,從大業路開出來,卻忘了右轉大度路,跟著前車上了洲美快速道路,將錯就錯乾脆去大稻埕碼頭。
碼頭走走,突然一行人肚子餓了,便走去永樂市場和迪化街那邊覓食。
吃飽沿著迪化街逛著逛著,Angel 的狀態已經顯示為沒電,趴在我的肩膀上頭滑呀滑的。
雖然我只剩下單手能用,身上除了小孩還有其他兩台相機,但還是可以拍照的。
禮拜天早上仍然是公園行程。
今天遇到一位熱心的小姊姊,她教會 Angel 一直恐懼的這項遊樂設施,還跟我們聊了很多,特別強調她很會教小寶寶,也表達了她長大以後想當老師的志願。
是說現在小一生長得會不會太高了一點?
Angel 為了感謝姊姊教她,也把她今天帶來公園的玩具拿出來分享,很抱歉這張我眼殘了。
後來公園來了一隻很漂亮的狗,很多小朋友都圍過去摸摸她。
本來一直覺得很奇怪,她的主人怎麼一直叫我們家女兒,才發現原來這隻漂亮的狗也叫做 Angel,兩個 Angel 坐在公園椅子上就這麼聊呀聊著,很開心。
今天也認識了一些新朋友。
其他本卷照片:Mamiya C3 vol.7
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!