跳到主要內容

發表文章

目前顯示的是 12月 28, 2008的文章

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

For Cawa

My Dear Cawa, 感謝妳帶給我一切, 從去年開始, 持續不斷的驚喜。 欠妳的鑽戒, 漏印的 Love Story, 每每惹妳生氣, 我總做不到完美。 然而, 不完美卻是平淡的生活中, 很美妙的部份, 大吵一架之後, 互開對方玩笑的我們, 是因為追尋人生的路上, 將一直有對方的陪伴。 還有很多事要妳多擔待的呢, 一起努力哦。

天使的笑

爸爸媽媽準備結婚的同時, 妳的陪伴, 如天使的降臨。 幻想著妳的臉孔, 妳的笑, 是如此美好而真實。 妳是怎麼決定成為我們的天使? 又會帶給爸媽什麼樣的驚喜跟挑戰? 陪著妳成長會增加我多少白髮? 然而, 多虧媽媽修飾了妳臉龐, 讓妳在與我有大部份的相似外, 還能如此絹秀, 巧奪天工。 偶然的笑顏, 趕走滿身的疲憊, 天知道妳能不能記得中山醫院病床旁的沙發, 妳與我共眠的初夜? 還是每個餵奶哄妳入眠的夜晚, 妳的巧笑倩兮? 能不能預知何時妳會和我大吵一架, 與我冷戰, 最後和好如初? 是妳帶著我體會責任感, 是妳治療了三十年來自大任性的我, 面對妳, 瓦解了我的武裝。 讓人憐惜不已的哭聲, 中斷我泉湧的文思, 上工去~