TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
準備駕照考試的馬麻
使用相機:Pentax MZ-3 + FA 28-90mm
使用底片:Fujifilm X-tra 400
沖洗店家:五色鳥
這次的裝備,MZ-3 + FA 28-90mm,很輕量化的組合,一機一鏡旅行算是夠用了。不過這次有個敗筆,我在 FA 28-90mm 前面裝了一個蓮花遮光罩,卻沒注意到廣角端畫面會遮到!但索性就不裁掉了,留著提醒自己。去政大拍的那天是中午,超熱的,據說那天還創下今年最熱的新紀錄!
#1 政大中正圖書館前的阿勃勒
#2 綜合大樓前的廣場,有一道迴廊
(被遮光罩擋到的部份,還蠻像暗角的,哈哈)
#3 河堤自行車道
#4 天氣好的時候,河堤這裡是看得到 101 的,十字架這裡是一所幼稚園,記得大學修幼兒教育時好像有去參觀過吧?!
#5 有一座小橋,跨過分洪進水口
#6 再熱,也要打棒球
#7 籃球就沒人打了
#8 大勇樓門口的這棵樹,蠻喜歡的
(Ya!)
#9 風雨走廊
#10 注意,行人優先
#11 綜合大樓前的廣場,蠻多人喜歡在這裡休息
#12 四維堂旁邊的這幾棵椰子樹,應該很老了吧!
這次是利用去校本部開會前拍的,沒想到一下子就拍完了,感覺還有蠻多地方可以拍的,有機會的話再去練習練習囉。
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!