TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
晚上十點喝完牛奶,她會花一點時間遊玩、發呆,做一些探索的行程。約莫十二點至一點間,她會進行第一階段的睡眠,大約一至兩個小時。兩點到三點間,大致上我女兒是安排了換尿布以及補充營養的行程,吃飽拍嗝後,會於四點到四點半間進入第二階段的睡眠,一覺常常就到天亮要上班前囉~
只不過,跟我個人的時間分配顯然是無法完全配合滴,晚上十點餵完陪她玩一下,我的精神也來了,於是開始上網亂逛,直到兩點看完「全民最大黨」,就差不多想睡了,然而此時想睡也不敢睡熟,預期我女兒醒來的時間不遠矣,有時候她睡得太熟,過了四點才醒,我大概就接近掛點了,餵奶的時候會呈現彌留的狀態,突然醒來時會發現奶瓶是空的,我的手拿著奶瓶壓在我女兒肚子上,女兒睡在懷裡的情景。
有時候體力還可以撐到餵完奶、拍完嗝,會把她放到餐搖椅上,搖到她睡著,自己也在沙發上睡著了!
不知道她是不是要人陪或者被我養成的壞習慣,還蠻不愛睡自己的嬰兒床的,什麼高檔的乳膠墊、音樂鈴啦都沒用,就愛客廳的餐搖椅,還有一個總是會讓她看到就笑的小搖鈴。
看著她一點一點的成長,突然發現的新動作、新表情,都會讓人感覺很可愛,對於精神不濟的這個狀態,就拋到九宵雲外吧~
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!