TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
作者 : ZENG (zeng.bailan.club) 標題 : 忠治出隊之記(四) 時間 : Thu Apr 13 10:47:06 2000 寒假的出隊,為了微辦的班,晚了一天出發。 騎著小F,往烏來山區騎去,飄著雨,努力嗅著熟悉的味道前進。 這次出隊的身份比上次的生管多了一個「女」,任務是負責全隊 上下所有人的五臟廟,俗話說的好:「大出若要吃得好,女生管 少不了。」可見女生管是多麼重要的工作。 看到這裡,你一定開始懷疑,「咦?宗正會煮飯哦?」嘿,這正 是玄妙之處啦!咱們女生管五人小組分工做得極棒: 首先為了口味一致,僅設大廚一名,負責所有烹煮、調味、等等 大大小小的工作。 再者為了食品清潔這樣重要的考量,設置二、三、四廚共三名, 負責打理所有洗、切蔬菜水果的工作。 最後終於輪到我啦!這之中最重要的莫過於負責端盤子將煮好的 菜和洗好切好蔬果盛裝好,由小弟全權負責。 至於先前那天翻地覆的煮菜工作我就不一定待在廚房啦!有時候 在外面跟小孩子打架,有時候跟老人聊個小天,悠閒愜意。 還記得看到一個很年輕的媽媽,背後背著小孩,手裡牽著另一個 ,坐在活動中心外面晒冬陽。 那時我正在外面跟一個國一生聊天打屁,順便跟一群國小二三年 級的小鬼頭打架。國一的瑋倫叫那個年輕媽媽堂姐,後來才知道 她只比我大一歲而已。 -- ※ Origin: YKLM大學 ◆ From: 140.119.191.100