TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
非典型學習者與非典型教育工作者 「非典型」相對於「典型」,程度極端者,近乎怪胎之意。 1997,銜父母之命,進了教育系。上諮商團輔課,總覺得自己應該是被研究對象而不是研究者;上課時間同學在教室遇不到我,但若到學校電算中心,我應該正坐在某個位置上;宿舍的桌上,沒什麼系上的課本,電腦螢幕卻常常是一堆爬得奇奇怪怪大刮號分號的文字。 大一到大四,每次上台報告或試教都是坑坑巴巴,台下同學的眼神訊息: 「你就不愛上課嘛」 「還以為你有多行,原來真的這麼爛哦」 「趕快下台吧」 「想幫助牠」 畢業前,我放棄了實習,父母非常不諒解。他們當時或許無法理解,除了我說的出口的理由,更多的是無法上台的自卑。在這逃離教師工作的十多年間,我大部份從事著與教育無直接相關的工作,憑著些許薄弱的資訊能力,掙口飯吃。 快轉這十多年,來到今年五月,我終於結束長達兩年的台北宜蘭通車生活,來慈心謀職。 八月底的學校教師研習,我在眾教師先進和長官們的面前報告了研習的心得;九月初,我第一次站上高中講台,那是我的第一堂課。 九月底,我和一位學生到台北進行專題的拍攝,在艋舺遇著一位專門拍攝東南亞人文題材的日本長者,一口流利的中文和台語。他讓我們看見長期耕耘的厚度,攝影者與被攝者之間因為相互信任而合力完成接近完美真實的影像。 教育,在我眼裡其實是很簡單的圖像。當你願意捲起袖子體驗人生,你自然就能成一本值得被翻閱的教材。 1997,Great Teacher Onizuka,好像一直還在我的血液裡。 吉米,2015 秋