跳到主要內容

發表文章

目前顯示的是 11月 23, 2014的文章

16GB ROCm 本地 LLM-as-a-Verifier 實測數據:Qwen3.5-9B 跑起來到底多快

TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...

未曾開始的結束。

(Minolta Hi-matic CS,Kodak T-Max 400 TMY) 移情,時常發生。 傑爾這幾年的婚姻,並非未曾對其他女性動心,也曾經被男性店員告白。 兩個人見到面,空氣總是瞬間凝結,傑爾和愛蓮都不愛準時回家。 傑爾每天下班回家前,會到公司附近的 7-11 買一包煙,坐在店門口抽它個一小時。晚班固定的那位店員云良,一進店門定會準備好傑爾慣抽的香菸,拿給傑爾,每天固定的聊上幾句。有一次加班,很晚,晚班店員交班了,他們買了兩瓶啤酒,愉快的暢飲閒聊,話匣子一開,云良提議唱歌續攤,於是兩個人開了個小包廂,通宵唱歌談天,兩個人坐得很靠近,情歌對唱何其開懷,兩手啤酒,杯盤狼籍。 對唱入戲,云良牽了傑爾的手,合唱擁抱,「抱緊我,吻我,哦愛別走」,情不自禁的吻了傑爾的臉頰。 震驚的傑爾,大動作彈開,尷尬的氣氛讓兩個人靜默了好久,連忙結束包廂,各自回家。 公司簽了一份大合約,客戶負責那次合作專案的窗口,有位可愛的助理妹妹婉君,每次聯繫,總是不自覺地多跟她聊上幾句,光聲音的甜美就能讓每天的心情愉悅到不行,對話像極了男女朋友的互相關心,默默的也生了感情。 兩家公司不遠,傑爾總是會安排在下班前,步行到客戶的公司,處理一些專案的相關事宜,下班時間,一起用個晚餐,陪婉君或坐捷運或坐公車回婉君家的巷口,目送她離開再自己搭計程車回家;平時愈來愈密切的手機聯絡,討論公事之餘也不乏調情的甜蜜,即使話語投機,興趣相投,兩人仍始終謹守著分際。 大半年的時間過去,八月十八,專案順利結束了,傑爾想要電話邀約婉君,一方面自陳離婚的狀態,二方面也想向婉君告白。訂好餐廳,滿心歡喜的打電話到客戶公司,才知道案子結束前,婉君便離開公司,撥了手機號碼也停用。 沒有開始,卻已結束。