TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
作者 : zeng (為能自由而沈默) 標題 : 忠治出隊之記(五) 時間 : Tue Aug 8 02:06:33 2000 升大四的暑假... 仍懷著被二一的恐懼.. 我又和一群學弟妹們上了烏來... 這是次蠻舒服的出隊... 倒是油錢傷了點... 每天來回政大與烏來忠治之間..... 一天約莫騎七八十公里... 小F所幸勝任愉快 這樣每天的來回... 才更發現烏來夜景之美... 天上的星星多得數不清... 早上的太陽更是舒服得讓人感動.. 每天往返烏政之間... 為的只是幫他們升火煮飯... 張羅每天的吃吃喝喝.... 雖和寒假出隊一樣是在廚房幫忙.. 但這次與上次大大不同... 這次廚房裡主要是四個人幫忙... 三男一女.. 這四個人會煮的東西並不多... 據說前三天的菜單... 主食全是麵食... 涼麵.. 義大利麵.. 炒麵.. 夏天天氣熱... 水果買得太少... 菜也準備得不多... 所以有人直到第五天才拉出隊以來的第一泡屎... 想來也真不禁令人掬一把眼淚.. 這次出隊我卻是吃得最快樂的一次... 因為所有的食物在還沒裝盤之前... 必定經過小弟嘴巴試吃.. 也可以比較確定哪些東西可以吃... 哪些東西不能吃.. 像後來有一次魚沒煎熟.. (不是我煎的~~) 雖然煎的人仍然堅持擺上來給大家吃... 但大家看我們動都不動那盤魚的賊樣... 就清楚的知道那盤魚肯定不妙... 跟著別人煮了這麼多天的菜... 多少也學了點皮毛... 現在最有把握的大概是煮大鍋飯和加鹽巴這兩項絕技.. 比起去年只會端盤子.. 進步不可不謂神速.. -- ※ Origin: YKLM大學 ◆ From: 140.119.191.100