TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
作者 : ZENG (1+2+3+4+5+6+7) 標題 : 賣紙是學顧的天職... 看美女是學顧的福利... 時間 : Fri Jun 4 03:33:09 1999 其實是為了禮拜四晚上阿扁的演講... 才跟人交換了星期三晚上微二的爛班來值.. 但對於當日紙張銷售一空... 造成洛陽一夕紙貴的情形.. 要感謝的人實在太多... 特別是本系的各大美女帥哥.. 以銷售量以及銷售的速度來說..... 當日一開市便由某大盤商包下了之前還剩下半包左右的紙.. 小弟趕忙跑到微辦補貨.. 順便也趕忙讓另一台印表機恢復動作.. 當時心想紙再拿一包大概夠了吧... 自殺概也是有殺完的一天吧... 不會再有一次六十張的了吧.. 沒想到... 果真人算不如天算... "學長.. 我要買紙.. 先四十張好了..." "學顧.. 我要五十張紙..." "學長.. 我還要二十張..." "同學.. 二十五張紙..." ................... 當日的庫存在本校師生熱情的光顧之下... 計中在九點半之前即宣布 A4 紙售完.. 明日請早.. 綜合一個晚上應付著各式各樣買紙的 user... 個人研究統計的結果大致可分為: 富家子弟型、啼笑皆非型、克勤克儉型 一.富家子弟型的典型例子會說: "學顧.. 我要一百張紙.. 一千塊給你找..." 二.啼笑皆非型則會問: "學顧.. 我這幾張印錯了.. 可以跟你換新的紙嗎?" 三.而克勤克儉這一型的人會問: "學顧.. 我這一面印壞了.. 可以再用背面印嗎~~~" 至於應對的方法在此不便透露... 內容涉及學顧甄選考試內容... 歡迎大家來參加培訓即可...