跳到主要內容

發表文章

目前顯示的是有「AMD」標籤的文章

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

窮人的 LLM-as-a-Verifier:16GB 顯卡 + ROCm 打造地端 0 成本 Agent 審查閘門

TL;DR: 這篇寫給不想被雲端 API 掏空錢包、又怕 AI Agent 盲目重構改爆 Codebase 的開發者。我們用 Radeon RX 9060 XT 16GB、Linux ROCm (HIP) 硬體加速,加上 Rust 寫的確定性 2PC 防禦門衛,手刻一套符合 PRM(Process Reward Model)規格的地端零成本 AI 外骨骼系統。 1. 痛點:Agent 狂歡背後的帳單破產與程式碼毀滅 Autonomous Coding Agent(OpenCode、Claude Code 等)大幅改變了開發流程,但附帶兩大噩夢: Token 黑洞與 API 帳單爆表 :為了確保程式碼品質,Agent 需要頻繁自我思考、多方案比較(Best-of-N)與長鏈修復。幾輪對話下來,雲端 API 帳單直接失控。 確定性缺失(Non-determinism) :沒有 Guardrail 攔截的 Agent 就像沒導航的賽車——隨時在背景修改全域 Interface、弄爛 DB Schema,甚至產生語法幻覺。 解答 :我們需要 Verifier(過程監督者)。但大廠論文動輒用 A100 叢集配 vLLM 預分配幾十 GB VRAM,一般開發者負擔不起。我們需要一套在地端 16GB VRAM 上順暢跑的「窮人版 Process Supervision 體系」。 2. 硬體與驅動層:為什麼選 Radeon RX 9060 XT 16GB + ROCm (HIP)? 在 Homelab / Linux (CachyOS) 環境下,配 Radeon RX 9060 XT 16GB 搭 ROCm Backend 是 CP 值很高的搭配: HIP 矩陣加速與 VRAM 吞吐 :透過 ROCm 原生 HIP 加速,16GB VRAM 能穩穩咬住 Qwen3.5-9B with mmproj(程式碼語意 + 多模態視覺)。 逃離 vLLM 的 VRAM 黑洞 :vLLM 預分配 90% VRAM 的機制在單機多任務環境是災難。改用 ROCm 版的 llama-server(GGUF 量化),模型權重只吃 5~9 GB VRAM,剩下的空間還能動態分配 KV Cache,主機照樣順跑其他服務。 0 API 成本 :2PC(兩階段提交)觸發一萬次 /...

閒聊 Xmrig CPU 挖礦

這兩年弄了三台 AM4 的電腦,並且在今年底 DDR4 記憶體大漲之前,大致上都已足夠,一定是等跌價或大量二手出現再考慮補齊插槽了。 我的兩台洋垃圾主機用的都是 DDR3 ECC,也基本都補滿了,沒什麼懸念。洋垃圾主機目前主要就是跑 LXC 和 Guest VM,通常我會沒事多開一兩個 LXC 讓他跑自己包好的 Xmrig docker,給他綁定核心滿速跑 RandomX 的挖礦。 RandomX  演算法主要是針對 CPU 挖礦設計,雖然 Xmrig 也支援 OpenCL 和 CUDA 去挖,但通常 GPU 有其他更有效率的演算法可以跑,不會特別想用 GPU 去算 RandomX,所以編譯 Xmrig 的時候,通常乾脆把 GPU 的支援拿掉也無所謂。 通常新聞裡面常常有的駭客植入挖礦程式,或者網頁瀏覽挖礦,都跟門羅幣 RandomX 這個演算法或者相關衍生以 CPU 為主的演算法有關,而且其實都已經存在很多年了,總是有人會發現有人不會發現,對大多數的電腦使用者來說,要發現可能也不見得容易,config 可以設定只最多佔用多少百分比的 CPU 資源,有些還做到用排程的方式跑,加上大多數人的電腦其實也都是效能過剩,沒有奇怪變慢的情況之下也不太可能去追查問題,優先權預設就是閒置的時候才使用大量資源去挖,所以被控制的閒置裝置,除了拿到資料和控制網路以外的價值,埋個 Xmrig 基本上算順便加減賺。 我目前的三台 AM4 電腦裝的都是 CachyOS,Arch Linux based distro。剛開始用 AM4 的時候,我最不習慣的是看到 CPU 溫度動不動就 80 度,原廠風扇換成六導管,或者主機板調個 PBO、電壓什麼的,最後能穩定跑在 60 度上下大概就是我目前的習慣數值。網路上說,習慣就好,AMD CPU 規定的溫度上限是 95 度,過了撞溫度牆反正就降頻跑,說真的還真習慣了。 16 個 thread 開 4 個挖,btop 排版好看。

回味礦卡 AMD GCN4/Polaris RX470/570/580

在用 GPU 玩 AI 之前,挖礦應該是當年很潮的顯示卡用途吧。 曾經同時擁有 10 張 RX470/570/580 8GB 的顯示卡,8 張在 HiveOS 裡面跑挖礦,另外兩張分別在兩台洋垃圾上使用,一台 Proxmox VE 的主機也是有 Passthrough 給一個 Windows vm 在挖,也玩過 Passthrough 給一個黑蘋果 vm,另一台只裝 Windows 就打遊戲和跑 Android 模擬器用,話說這個配置少說已距今八年前了。 大約四年前,那時候好像又有一波礦潮,有人在收礦卡,我看價格還不錯,那 8 張挖礦用的卡就都清掉了,只留著空的礦機機箱和主機板。 今年上半年我有把手上剩下的這兩張 AMD GCN4/Polaris RX470/570/580 8GB 顯示卡測試了一下跑 Vulkan llama.cpp,跑 8B 以下量子化過後的模型,坦白說也還算能用。 RX580 這張卡到 2025 年的可玩度,考慮他出廠的年紀以及在那兩波礦潮中各種極限環境下努力工作的狀態,真可謂老驥伏櫪! 這張顯卡現在要挖礦是有一些效率比較差的狀況,安裝支援 OpenCL 1.2 的驅動那些比較麻煩一點,昨天搞了一個下午,用一個 Ubuntu 20 的 LXC,使用 amdgpu-pro-20.30-1109583-ubuntu-20.04 裡的 amdgpu-install 終於裝成功支援 OpenCL 1.2 的驅動,總算可以成功跑 lolMiner。跟今年才誕生的 9060XT 對比,同一種演算法 BEAMHASH 可以跑出個 15 比 20 sol/s。 哦,最後我比較意外的是用 Intel A380 挖 BEAMHASH,能源挖礦效率非常好耶,本來這張很單純是想用來轉 H265 為主的卡,但想不到他的每瓦效率 (sol/s/W) 可以達到 0.187,只花 50W 不到的電力,大概可以跑出 7-8 sol/s,甚且還是張台幣 4000 元以下的顯示卡。