TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
作者 : zeng (嗯哼哦厚啊哈~) 標題 : 學顧學顧,身體要顧 時間 : Thu Jun 29 01:09:28 2000 小弟學生助理(以下簡稱學助)的生涯,至今年六月底為止,正式宣 告結束。任內之功過,毀譽參半。此時的我,無官一身輕、無事一身 閒的喜悅和空虛同時湧入心頭,轉眼間,大學三年就這麼無聲無息地 過了,不過反省並非小弟的風格,過去就讓他過去~像ㄜ便便一般, 沖完水水就啥也不留,當然這是就一般正常狀況而言。 學助的工作,先前小弟已於本版發表過相關的介紹,因此不再贅述, 若要我給這個工作評個分數,根據事少、薪多、離家近的原則來看, 我給它85分~其中有84分是特別加分加給排班特權這件事~ 我相信,排過班的人都同意,排班肯定是門極須頭腦和心機的學問。 姑且不論每個人一定要有至少六個小時的下限要求,光是要把自己喜 歡的人跟你排在同一時間值班,把討厭的人或情敵踢到微二給他賣一 整天的紙就已經足以讓你頭疼地睡不著吃不下了,難就難在如何幹得 不著痕跡、不令人起疑,其中之巧妙惟有親身經歷方能深自體悟。 最近又開始的學顧培訓甄選,三天總共來了六七十個人,我們除了再 一次呼籲新政府正視不景氣持續低迷的氛圍,大刀闊斧地從事經濟改 革,以突破目前由於經濟不景氣所引起之工作供不應求的困境。除此 之外,雖然據說本次前來參加的學顧培訓的同學們並無『0+1』小 姐之流,但培訓小組仍將秉著有教無類的教育精神,為生產新一批學 生顧問,竭盡一己之力。我們期許未來教育系能在計中佔下五席以上 學顧名額。 前陣子ㄜ便便的時候(可見有好一陣子沒有ㄜ便便了),突然對煙味 有一種莫名的親切及好感,先前一位戰友留下來滿室的煙味,讓我大 口大口地吸著,完全無視於離屁眼底下三十公分處,那一坨又一坨奇 臭無比的廢棄物,倒也十足自在快活地享受了個舒適愉悅的午後ㄜ便 便時光。 卸任了單身聯盟會長的職務以後,小弟開始往『狗』皮條界發展,為 了能在擁有此界獨佔鰲頭、獨霸一方的地位,先後參加許多座談會及 研討會,研究狗的心理並向赫赫有名的狗學權威P教授學習如何從流 浪狗的眼神看出其一生歷...