TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
我大概是去年開始全面只用 Linux 作為桌面工作和玩遊戲的作業系統,以前通常多留個 Windows 做 grub 開機可切換,MacBook Pro Intel 也被我裝了 Linux with Sway。 這也差不多是 Linux 各大 Distro 開始從遠古時代的 X11,漸漸進入預設採用 Wayland 的時代。 因為 X11 時玩過 i3,所以第一個入手的 Wayland Compositor 是 Sway,因為他是 i3 兼容的 Wayland Compositor,Tiling Layout 對於 Terminal 工作者來說很友善,甚至可以用靈魂契合來描述,特別是你要同時處理很多台遠端機器,平鋪起來真是銷魂。 通常一開始也不用特別搞什麼,預設的熱鍵通常是 Super + Enter 開一個你喜歡的 Terminal 軟體,然後配個 Super + d (d for dmenu) 可以開一個 Application Launcher 像 rofi, wofi, fuzzel 這類,上方或下方弄個還看的下去的 Waybar,就可以組成一個很好用的桌面環境。 大概在今年三月之後,fcitx5 輸入法和 Google chrome 瀏覽器在 Wayland 上相容性的問題漸漸都解了,要不然在這之前,通常都先用 Firefox 當預設瀏覽器,因為 Google chrome 在那一陣子的更新,伴隨著 Wayland 的輸入法架構有變動,常常會發佈新版本就會出現沒辦法輸入中文或者只有第一個視窗可以輸入中文的情況。 Terminal 的話我最喜歡 foot 的輕量並且是純 Wayland,所以我預設的 Terminal 通常是他。想用可以多開 Tab 的 Terminal 我會用 Kitty,通常設定一個 Window Rule 開 Floating Terminal。 然後 Sway 弄差不多以後,大概就看到 Hyprland,漂漂亮亮的 GitHub repo 設定檔和桌面截圖,然後就也切換到 Hyprland 的環境也大概搞一陣子,把一些快速鍵觸發軟體或 script 的習慣都在 Hyprland 上設置一份,搞定一些兩者有差異卻要共用的軟體設定,這大概是第二步。 最近 Niri 是我的主要桌面,這比純 Tiling Layout 多了可左右延伸的滾動,同...