TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
關於 K10D 工程模式 (韌體必須為 1.10 版):http://forum.pentaxfans.net/showthread.php?t=44397
但是我已經升級成 1.3 版,而且韌體版本是不可逆的,網路上查得到的方法有兩種:一是裝偽 1.3 版 (版本號碼為 1.3,但實際為 1.10),另一是使用軟體透過 usb 連接線開啟工程模式。
我試了第二種方法,是一套俄國人寫的軟體:GX10-K10D Debug Mode Control
文章參考:ricehigh: K10D Firmware 1.3 Debug Mode Unleashed
下載位址:(昨天測試的時候抓到俄文版,仔細再找網路文章才發現也有英文版,暈)
1.俄文版:http://dednev.pisem.net/setup_gx10_dmctrl_1.1.exe [註:密碼是:penta-club.ru]
2.英文版:http://dednev.pisem.net/setup_gx10_dmctrl_1.1u_eng.exe [註:密碼是:penta-club.ru]
原始網站:penta-club.ru [如果你看得懂俄文的話]
軟體安裝之後,用 USB 接上 K10D,然後開啟軟體,點選第一顆按鈕

然後按照步驟:
1.開啟工程模式 2.執行 3.關閉程式

ps. 按下「2.執行」會出現一個視窗,我也看不懂,按確定就對了。

然後,從電腦移除你的 K10D,你會發現閒置狀態下會有一個 Debug Mode 的畫面,不會影響你的正常功能。
工程模式的位置在:MENU -> 設定 -> 最後面三個:
包括:CAPTURE/SYSTEM TEST、AF TEST、STRINGS DISP TEST
其他的就自己玩吧,參考一開始 PFC 那一篇,寫得蠻好的。
留言
張貼留言
回應不用錢,請多多益善!懶得寫字按個讚也是相當感謝!