TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
(Mellchan,Sony A450,Minolta AF 50mm f1.7,Lightroom 3)
農曆年回台南,阿公帶 Angel 去逛玩具店,Angel 一進店門口,一把就抱起短髮小美樂,衝到櫃枱要結帳了。
這代表,Angel 是個哈日的孩子嗎?
不過這東西,恐怕大人好奇愛玩的程度也不亞於小孩子吧,很多配件都做得精緻,亂有意思的,日本 Mellchan 官網一進去就是可愛到爆。
回台北前,阿嬤又為 Angel 做了一組小美樂的布製搖籃提袋,也有枕頭和棉被,很有年味的搖籃提袋,不過回台北後,Angel 目前為止最喜歡的就是幫美樂將脫光光,嚷著好冷唷,然後再幫美樂將穿上衣服。
hello...i would like to know how you add the share buttons on the bottom of your post: "facebook, twitter, plurk.....etc"
回覆刪除thanks a lot!
@小星星,I use addthis,Just see:http://www.addthis.com/
回覆刪除