TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
這是我買給 Angel 唯一的玩具,其他的都是老婆在張羅。
小時候,一開始 Angel 還可以隨著音樂聲入眠,不過那時應該不管放什麼音樂都好睡吧!後來有一陣子 Angel 在自己的嬰兒床裡都睡不安穩,在保姆的建議下,Angel 就跟我們一起睡到大床,空著她的嬰兒床,也就很久沒幫音樂鈴裝電池了。
會選擇這個玩具主要是看上它的多功能,除了上面的吊飾可以隨著音樂旋轉,也可以拆下來讓 Angel 玩,不聽音樂鈴的那一陣子,這幾隻小動物就是跟著一大堆小玩具供她選擇把玩,她手裡這隻小兔子就是其一,因為捏小兔子耳朵會有聲音,所以蠻常看她拿著把玩,捏捏耳朵。
最近看她從嬰兒床裡站起來,會跑到後面安裝音樂鈴的地方敲敲打打,好像在跟我說:「把拔,怎麼沒聲音?」。
昨天一幫她裝好電池,Angel 發現自己按按鈕有聲音之後,就會自己去試著按按其他的鈕,發現不同的音樂。
我發現 Angel 很常去按最底下那一排,最底下左邊那顆是她小時候我最常按的,因為那是可以感測小孩子的哭聲,然後啟動旋轉音樂鈴,有一陣子還蠻能讓她在半夜醒來時被音樂安撫而睡著,我們也才能再多睡一會兒,後來就沒效了,大概是 Angel 已經知道這是呼嚨她的東西,不是把拔馬麻真的來安撫她,聰明的咧!
這個音樂鈴有附遙控器可以切換歌曲,我果然是個懶惰的把拔。
Angel 會站起來之後,我就把上面掛的小動物拿掉了,因為那支掛桿是塑膠的,並且也不是固定,怕她一拉跌倒然後弄到她就不好,昨天連那支彎桿也拿掉了,因為現在只需要音樂功能了,所以我想她大概在找怎麼有一個東西不見了吧!
以功能性來說,我覺得可以讓 Angel 在不同時期,發揮不同功能是很好的設計,妳看連 Angel 都拍手了!誠心向您推薦。
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!