TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
日系 70 年代的 RF 相機中,有七台被有心人命名為七劍,很剛好我一台都沒有。 當然七劍都有與同時期 RF 相機相比之下所產生的優點,但其實就像你或許在 Panasonic 推出 GF2 的時候仍然喜愛 GF1 多一點,那都是一種見仁見智的感受,對於別人的推薦清單,你可以認同並追捧,但就是需要多付一點錢。 比如說大家一直說 Canon QL17 長得多好看多強大什麼鬼的,我是可以認同保留全機械操作再送你自動曝光功能,這對於幾十年後的收藏者或擁有者來說,電子部份壞掉還能繼續拍照是蠻好的,但你千萬別跟我說他長得有多好看,比他好看的相機多的是! Olympus 列席七劍名單也太多台,大概只能說是對手太弱而不是真的太強,畢竟要認真湊出七台還真的不是那麼容易。 最後是七劍裡面有一台 Petri Color 35,一來他是估焦,二來他光圈最大也只到 f2.8,我一直都認為可能連他自己都被列名的有點莫名奇妙吧,他可能會說, Petri ES Auto 我兄弟更強大家怎麼都不認識來著。 言歸正傳,如果你要找一台大於 f2 的大光圈 RF,又能接受除了設定 ISO 和閃燈 GN 之外什麼都沒辦法控制 (當然可以設定 ISO 你可以做一些手腳,頂多就是加減 EV 的遊戲而已),光圈快門完全交給相機處理,那麼你就可以參考這台 Minolta Hi-matic E。 Hi-matic E 比名列七劍的 Hi-matic 7SII 多了貼心的底片裝片指示,一樣大的 f1.7 光圈,最速快門到達 1/1000 秒比 7SII 還讚,而且血統純正不像 Hi-matic 7SII 一般被認為是 Cosina 代工製造。 來跟 Hi-matic CS 比一下大小: 主要規格 感光度支援: ASA 25 ~ 500。 鏡頭: Rokkor-QF 40mm f1.7,為 Minolta 早期有標示鏡片結構的鏡頭,Q = 4,F = 6,鏡片結構為六片四群,口徑 49mm。 最近對焦距離: 0.8 m。 自拍撥桿: 有,約 10 秒。 測光: CdS-meter,全自動曝光,沒得設定光圈快門。 快門: Seiko ESF 電子式鏡間快門,2 秒 ~ 1/1000 秒,沒有 B 快,為鏡間快門機種少見的 1/1000 秒快門,以年份來看應該...