TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
作者 : ZENG (工友小正) 標題 : 學顧學顧... 學分要顧... 時間 : Wed Mar 31 09:09:40 1999 這學期的時數... 應該是全計中排行前幾名的吧... 學姐說那是『開低走高』.... 我想她說的是"誰叫你一開始填那麼少班.. 死吧!! 哈哈" 唔.... 真狠.... 每天晚上... 除了一、三是我刻意留下來給社團的時間... 其他的晚上都會出現在計中.... 就連雙數週的星期六晚上也不例外... 其實這種死命掙錢的心態是值得做研究的... 通常歸咎其行為之動機後.. 通常可以發現這種人分成兩類.. 一種是真的很缺錢.. 這種人可能是住在外面.. 或是辦了手機.. 還沒跟家裡報備... 或是家裡不同意的情況下自己先出錢... 生活在每天都被房東摧討房租的壓力之下.... 會分泌出腎上腺素.... 充滿戰力的待在某地方搞錢... 這種人可以用詹腥汗之流來做為例子... 另外一種是人生的悲劇... 或說是忘情於工作.. 難以自拔.. 何以寄情於工作... 通常可以歸因為以下二點.... 一是交不到馬子的羅漢腳.... 二是被馬子拋棄的可憐蟲... 這兩個致命的動機會讓一個人失去理智的搞錢... 費盡心思也要幫別人代班... 絕不能被別人搶先一步... 尤其是看到新考進來的學顧和老的學顧.... 帶著女朋友來計中談情說愛.... 上班還有女人陪的心路歷程... 其心淌血... 只好化悲憤為力量.... 不擇手段把那些人的班搞過來值... 事實上這種人算是犧牲小我... 成全別人的感情的偉大人物.. 因為根據作者本人的研究論文集第五章提到... 這些人沒來上班的十大原因之首... 正是陪女朋友散步聊天... ㄠ.... 就連學姐也默許這種不成文的規定....... 不公平.... 學姐也有男朋友.... 我要上訴.... 唔.. 張小姐也有老公.. 單身漢果然是弱勢族群... 生存在這種主流文化壓迫之下.... 明哲保身.... 還是乖乖幫別人代班吧.. 認命點... ...