跳到主要內容

發表文章

目前顯示的是 6月 23, 2013的文章

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

無力感

(Topcon RE Super,TOPCON RE. Auto-Topcor 58mm F1.4,Perutz Primera 200) 越來越覺得力不從心。 症狀明顯的時候通常是某某朋友「又」在規劃出國旅遊,或者正在考慮買哪一棟房子,還是正在裝潢剛買的房子;又或者投資了一個好標的,或關心的朋友勇敢朝向夢想邁進,力不從心的症狀就會跑出來問候自己。 去年以前,或許還能用一個人出門拍照來稍稍化解,當時間越來越不夠之後,我常在想,是我的習性還是什麼自我管理不好造就了自己的人生,抑或我只能選擇過這樣忙碌的人生? 其實好像不容易找到快樂的因子對吧?看著別人實現理想的我是快樂的,快樂的瞬間回頭看見自己立刻掉到谷底。 一事無成還真的是。

與你心愛的相機合照

(Graflex Crown,Schneider Xenar 135mm f4.7,Fuji FP-3000B) 我們設立了一個 Tumblr 微網誌,想要徵求相機和人的合照。 網址:【 相機人。 】,同時也設立了 FB 社團:【 相機 ◆ 人 】 投稿的方式可以直接在 Tumblr 網誌的下方功能列點擊 Submit,或者張貼到 FB 社團,我們會標記照片提供者以及照片裡出現的相機。 當然,你對相機愈博愛,就可以投稿愈多張囉! 啾咪。

Fuji FP100C 轉印

今天去了一趟 198,陪一群很有意思的朋友一起聽講座。 在那邊看他們玩 FP100C 轉印好好玩的!回來就隨手找了本筆記簿先上了,看來是該買一本來做紀錄的,好有意思。 簡單的做法是找一本筆記本,然後把剛撕開沾著未乾顯影藥水的負片那邊貼在筆記本上,用手指碾壓就完成了。 詳細可以參考這邊,除了轉印還有移膜的玩法: http://www.wretch.cc/blog/goneihu/7959822 影片也可參考:How to: Make Polaroid transfers (From: http://youtu.be/T3zTC-yXuuw )