TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
玩累了睡著,像不像個沒電的超級瑪俐歐!
自從 Angel 睡上我們的大床之後,好久沒在嬰兒床上睡著囉!
最近我們把嬰兒床搬到客廳,權充遊戲床使用,讓 Angel 可以坐在裡頭玩玩具,享受獨處的時光。
Angel 還是會因為肚子餓在半夜醒來,餵完ㄋㄟㄋㄟ之後,抱了她一下,覺得她似乎還沒有什麼睡意,所幸先把她放進遊戲床,放一些輕鬆的音樂給她聽,在她身邊放滿玩具,讓她自己玩玩,想說等洗完她的奶瓶後,再來抱抱哄她入睡。
等我洗完奶瓶,拿到消毒鍋放好之後,就看到睡得香甜的 Angel,哇!她好久沒在嬰兒床上睡著了耶,而且姿勢真是可愛,以瑪俐歐跳躍的姿勢,被身邊滿滿的玩具圍繞著,真是太可愛,趕緊拿了相機拍下來!
(圖片來源:http://www.game-on.com.tw/)最後也來回味一下義大利水管工人瑪俐歐的歷史吧!(From Wiki),對了最近高雄的國立科學工藝博物館有「GAME ON 遊戲時代電玩-設計與文化特展」,展覽到十月三十一日哦!找機會可以好好地去回味一下各種電玩遊戲唷~
有你這位家庭攝影師,是我和Angel的幸福。等到Angel以後嫁人,我們有大把的照片慢慢回憶!
回覆刪除