TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

Dell 怎麼了?一個向來以線上訂購客製自豪的公司,怎麼會在一個月不到的時間,發生兩次錯誤(螢幕、筆電)。還記得六年前買的 Latitude D600 就是這麼從海外運回來台灣,當時還覺得很新鮮呢!
如果從內控來看,Dell 的風險控管大概是在訂單的條款上寫了:「他們有權取消訂單」。從某角度來看這兩起事件,Dell 已經展現行銷上的新絕招了:「烏龍行銷」。
我想,以在台灣瞬間打開的知名度來看,Dell 的確是勇於創新的廠商!(笑)
訂了貨的朋友們,聽歌吧!
【歌詞:說好的螢幕呢 (dell字幕版)】
妳們客訴持續著 在這個時刻
我想起那一天的價格 心頭淌血了
網站莫名的打折 我還愛錢呢
而妳陸陸續續的下標 要我出貨了
時間過了 走了 決策面臨選擇 妳厭了 倦了 投訴了
下標時那份快樂 DOGI用八卦版寫著 有些折扣只給到這 真的賠了
怎麼了 我累了 要賣的 螢幕呢
我賠了 不出了 裝死了 後悔了
賠錢與賠商譽一一細數著 我再不捨
那些媒體的壓迫都太深刻 我都還記得
妳不等了 說好的 螢幕呢
我錯了 出包了 賠上了 商譽了
只是消保官的來電還響著 要怎麼停呢
怎麼了 我累了 要賣的 螢幕呢?
賠本了 不賣了 裝死了 拖一星期就沒事了不想出了 要賣的 螢幕呢?
聖人呢? 工讀呢? 護航了? 過關了?
就等不爭氣的鄉民互相挑撥著 就這麼贏了
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!