跳到主要內容

發表文章

目前顯示的是 9月 2, 2012的文章

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

機會

(Konica Autoreflex T2,Konica AR Hexanon 21mm f4,Perutz Primera 200) 人家常說,機會是留給準備好的人,我總是沒做好準備。 上個禮拜,我婉謝了一位在大學教書的網友邀請,他希望我去課堂上分享身為部落客的這檔事。 我一度答應了,並且想好開場白:「在座各位同學沒聽過我的部落格,覺得老師的課綱寫說什麼知名部落客想翻桌的,現在可以翻完下課。」然後想像一百人的講堂只剩下三個因為被倒下的桌子困住不知道要去哪的同學繼續坐著,人一少我想後面講起來就很順了。 我認為,部落客是一種自言自語並自娛的存在,合則來不合則去肯定是最好的選項。你不小心點進來看了,覺得爛立刻離去是再自在不過的行為,這才是部落格展現多元價值最有趣的部份。 一張圖或許吸引你繼續看了底下的內容,沒梗頂多花個一分鐘快速閃人。有時候流量的暴增出乎意料,現實的朋友偶爾談到有個網友跟他或她聊到弱格吉米言,有人發問,有人轉貼,有人訂閱,老實說真正有趣的是網路與現實之間的關聯,只是我喜歡存在於網路上,但也不畏懼實名化,我在有限的時間裡寫筆記並且玩樂,有人可以因此節省時間,我也容易回想起一些往事,對我來說就是持續的動力。 我常說,我最早會想自己研究電腦是為了打電動﹑看謎片之類的生理需求,這動機讓我截至今日仍賴電腦維生。 如果用拍照來談,我覺得那是一種衝動,持續性衝動,我們對特定的事件場景有所感受,有些人拿筆,有些人掏相機,因為掏相機常常錯過或拍不好當下的感受,所以開始學習拍照的技法,最根本的都來自於動機。 如果抓住機會指的是能不能功成名就,那麼我認為有動機就夠你活得有意思了,追隨你的起心動念,玩樂一輩子吧! 如果真的去了課堂,我會繼續談部落格的禮儀,但與本篇離題,就此打住。

手指畫.Angel

昨天晚上 Angel 用我的手機畫的圖,覺得很有意思。 這張是她的自畫像。 這張是學校的廚師阿姨。