跳到主要內容

發表文章

目前顯示的是 12月 7, 2008的文章

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

無論你怎麼看野草莓

我想, 我是認同這些大學生的訴求跟勇氣, 同時也有一種人心冷漠的惆悵。 這幾天騎車經過兩次自由廣場, 很感佩這些小朋友們展現的精神力。 台灣? 應該是一個國家吧? 這些議題都跟你我有關, 今天你的冷漠, 或者是你自劃界線認為草莓們是敵對政治立場的槍手, 請你想想, 沒有了自由且自主的台灣, 會是怎麼樣社會, 冷漠, 真的是你所希望的嗎? 我來自很平凡的家庭, 國中時我曾經引用當時的報章雜誌, 在作文比賽中寫下民進黨亂了社會秩序, 最後連續兩年拿下了全校作文比賽的冠軍, 我的筆法很老成, 沒有國中生的嬌嫩, 卻犯了盡信書不如無書的大錯。 當我慢慢長大, 愈來愈多的政治大物扛著社會改革的大旗, 形塑被不民主的社會所迫害的被害者形象, 我才慢慢體會到我最愛的學科歷史, 有著勝者為王敗者為寇的特性, 權利的爭奪, 無非是為了撰寫正史, 更甚者還能控制年幼的我們所受的教育, 使我們先天就缺乏民主的素養, 只遵循統治階層所給我們的標準答案, 進而獲取工作, 成為為統治者所用的士大夫階級。 用著開放的心胸, 接納與我相反的立場, 試著從別人的眼和心, 期盼體會我所未知的世界, 台灣, 沒有撕裂的本錢, 其實身處國際公義社會的我們, 擁有相當可貴的價值, 人權, 是不能拿來箝制, 是無法控管其萬一的, 人心再不能冷漠了吧, 即使野草莓的作法有很多可受公評之處, 但面對孩子們的勇氣, 我們是相形見拙的, 不是嗎?