TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
小姐姐看到 Angel 的玩具很開心耶,不過 Angel 熱昏了都笑不出來!
下午悶熱,我們還是帶了 Angel 到秀朗國小散步走走,以免她假日在家無聊,順便消耗一下她的體力,晚上好睡一點。
遇上一位年輕的奶奶,也帶著小朋友來秀朗散步,看她跟孩子的互動很親密,本以為是她的孫子,聊聊才知道她是幫朋友帶孫子,這個小姐姐差不多大我們家 Angel 一個月,看起來好成熟的樣子唷!
小姐姐很不怕生,很會看著鏡頭擺 POSE,也很愛笑!我想她應該很習慣來秀朗認識朋友,所以表現得相當大方自然!
(你腳骨有這軟Q否?)(和風戶外人像 Preset)
比起人家小姐姐,我們家 Angel 整個熱昏了,都笑不出來,吹冷氣習慣了,哈哈,我也是一直流汗耶!馬麻很貼心地為 Angel 搧搧風。
這位年輕奶奶還跟我們分享了好多育兒經哦,從言談之間覺得她是把這孩子當成自己孫子一樣的用心,一天洗三次澡耶,而且還早早就訓練小姐姐晨間定時上大號,小姐姐也習慣甚至都不會大在尿布裡反而喜歡姨嬤幫她ㄜ便便,而晚上更是九點就寢,九點半睡著,約十二點時候會把小姐姐挖起來喝ㄋㄟㄋㄟ,然後一覺到天亮耶!真是令人羨慕呀!因為小姐姐馬麻的工作是輪班制的,所以年輕奶奶也是配合著輪班,偶爾也要全日托嬰照顧,我覺得因為年輕奶奶對待這個小姐姐就自己的孫子,覺得有一種讓人很心安的感覺。
年輕奶奶說她是因為帶她自己的孫子帶出心得來,朋友特別拜託她也要幫忙帶他們的孫子,她還會自己安排小孩子聽英文錄音帶跟輕音樂的課程,感覺蠻用心的,看著這個孩子很開朗的笑容,就能感受她的開心跟自在。
掰,下次見哦!
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!