TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
丈母娘跟老媽都有打電話來,聽到我們去剪頭髮的反應都是:「天氣這麼冷,幹嘛去剪頭髮?」
我們一家三口的頭髮都太久沒整理,又即將要過年了,總不能亂七八糟的去拜年,雖然天氣冷到我真的不太想出門,但還是去剪了。
因為我很怕被洗頭洗到痛,老婆先去剪,我在出門前特別先洗好頭,正要吹乾的時候老婆剪好了,於是頭還沒很乾就抱著 Angel 下去修瀏海,然後最後再輪到我剪。
我對按摩的力道並不是要求強力型的,承受力比老婆還要低,但我通常不太會當場請小妹改變力道,總之我幾乎不說話,也沒什麼意見,但默默地評分著。
我常常等到小妹洗得差不多,最後很制式的問上一句:還有哪裡需要加強的嗎?我都會很想說,大腿內側(誤),不用了,已經太強了。
今天因為成功省下前面洗頭按摩的步驟,直接開始剪頭髮,覺得理髮的心情蠻舒暢的。
話說每次剪頭髮,從小到大我最喜歡的是讓電動推髮器由脖子下方往上把髮線推高的那一刻,麻麻癢癢,加上金屬冰冰涼涼,有說不上來的奇妙感受。
剪完頭髮,設計師很堅持要幫我洗一洗頭,我本來想說如果是力道強大的小妹洗,就讓她把頭髮沖乾淨就好,不過今天卻是設計師親自出馬,很奇怪的是,她的力道很剛好,很剛好的剛好,洗完頭之後還多做了一個熱毛巾熱敷,很好,我喜歡!
回家一問,原來是老婆在剪的時候,有意無意聊到我以前為了剪頭髮頭皮被搞得很痛而因此換別的設計師的事蹟,怪不得今天設計師還親自來洗,真是不好意思。
其實像我這種小額的消費者,又不常剪頭髮的人來說,這麼用心的設計師肯定是能夠留住我,至於會不會影響我理髮的頻率,那就得看我的懶病好了沒吧?
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!