TL;DR: 用 Qwen3.5-9B(Q4_K)在單張 16GB AMD GPU 上跑本地 LLM-as-a-Verifier,每次 code comparison 約 0.5–2 秒,cache hit rate 66%,正確程式碼穩定給 1.0 分,有 bug 的給 0.0–0.14 分。16GB 跑 9B 模型綽綽有餘,還有空間跑其他服務。 這篇是實測續篇,前兩篇分別講了 架構設計 和 Docker 封裝 。前兩篇講的是「做什麼」跟「怎麼做」,這篇來量「到底多快」。 1. 測試環境 在一台 homelab Linux(CachyOS)上跑的: 項目 內容 GPU AMD 16GB(15.9 GiB)via ROCm 模型 Qwen3.5-9B(8.95B 參數,Q4_K ~5.7GB GGUF) 後端 llama.cpp(llama-server,ROCm HIP build) Verifier Docker container(llm-verifier),port 8010 模型 VRAM ~10.2 GB(模型本身 + 動態 KV cache) GPU 使用率 78% 系統 RAM 62 GB;使用 27 GB(swap 用了 9.3 GB) Context window 131,072 tokens MIN_SCORE 0.8 後端跑在另一台機器上,走 local Gigabit 網路連線。 2. Verifier 在幹嘛 docker-llm-as-a-verifier 包裝了 LLM-as-a-Verifier 這個研究套件,讀取 token-level log probability 來算連續分數,不是簡單的 yes/no 判斷。 Container 開了 7 個 HTTP endpoint: Endpoint Method 用途 /health GET 健康檢查 /v1/compare POST 兩組答案比對評分 /v1/select POST Best-of-N 選最佳 /v1/track POST Agent 軌跡分數追蹤 /v1/directed POST 導...
官方版安裝小精靈:http://www.google.com/buzz/api/admin/configPostWidget
上面那個 Google 官方的頁面,你可以選擇你要的樣式,然後會產生語法給你,你直接複製安裝到你想放的版型位置即可。
我這篇想特別提的是當你想安裝在首頁會同時出現好幾篇文章,每篇文章都有一個 Buzz Button 可以分享該篇文章的情況。(如本格的方式,But I just show it on the IndexPage now)
因為預設的語法分享的是 Current Page,因此你必須加一點參數進去:.
<a class='google-buzz-button'
data-button-style='small-count'
expr:data-message='data:post.title'
expr:data-url='data:post.url'
href='http://www.google.com/buzz/post'
title='Google Buzz'/>
<script src='http://www.google.com/buzz/api/button.js' type='text/javascript'/> 其中:
expr:data-url='data:post.url' 表示分享的是該篇文章的 URL;
expr:data-message='data:post.title' 則是該篇文章的標題(這個不見得要加,可以讓 User 自己進畫面之後在訊息區填,預設會留白,而網址的標題會自動抓上面那個 URL 的 title)
安裝成果如本格首頁所示,我是採用 small-count。
大大你太強了
回覆刪除我約略照大大的設定
不過我的Buzz放首頁
連結過去還是只分享我的首頁
照大大上面所寫google所提共的Buzz按鈕
是否可以改圖片
還是需要下載他的JS然後更改他的圖片鏈結
JS上傳網頁再改JS上傳網址
還有想說把我的程式碼給大大看
可是沒辦法我貼在大大的臉書好了
你現在使用的語法有問題,我已經回信給你,請您參考。
回覆刪除用你的語法,圖片可以換成你需要的,至於官方的 js 如你所說,想換的話可能要抓他的 js 下來,你可以自己玩玩看。