LLM 性價比追蹤

Intelligence · Elo · 速度 · 價格 — 一張圖看懂誰最抵

載入中… AA Elo NanoGPT

性價比散點圖 X:混合價 $/1M(3:1,log)· Y:品質 · 綠線 = Pareto 前緣

性價比排行 品質 ÷ 混合價,越高越抵(前 15)

模型比較表

模型 廠商 Int Elo In $/1M Out $/1M 混合 $ NG In $ 價差 tok/s Context 性價比 ▾

歷史趨勢 快照累積後生效 · 綠=品質(左軸)· 橙=混合價(右軸,log)

① NanoGPT 價格 — 即時更新

NanoGPT 的目錄 API 允許跨域,可直接在瀏覽器抓最新聚合價(本次瀏覽有效,不入庫)。

② AA / Arena — 拖放 HTML 快照

在瀏覽器開啟 artificialanalysis.ai/leaderboards/modelsarena.ai/leaderboardCtrl+S 另存完整網頁,把 HTML 檔拖到下方。頁面會本地解析出 Intelligence / Elo 數據,可下載 JSON 交給 agent 入庫部署。

AA Intelligence拖放另存的 HTML未解析
Arena Elo拖放另存的 HTML未解析

③ 一句話叫 agent 更新

在 OpenWork 對話輸入:更新 llm-tracker 快照並部署 — agent 會抓三源、合併入庫、TUS 上傳並清快取。

資料來源

  • Artificial Analysis — Intelligence Index v4.x、原廠 $/1M 定價、輸出速度、TTFT(SSR 頁面解析)
  • LMArena / arena.ai — 群眾盲測 Elo(95% CI、票數)(SSR 頁面解析)
  • NanoGPT — 聚合器每百萬 token 定價(公開 API,瀏覽器可直連)

性價比怎麼算

  • 混合價 = (3 × input + 1 × output) ÷ 4,即 3:1 用量假設;散點 X 軸用 log 尺度。
  • Pareto 前緣 = 在「便宜且強」方向沒有其他模型同時優於它的集合(綠線)。
  • 性價比分數 = 品質 ÷ 混合價。品質預設用 AA Intelligence;切到 Elo 時整頁(圖、排行、表)一起換算。
  • 同一模型多來源對齊用名稱正規化 + alias 表;對不上的會只出現在有數據的來源欄位。

注意

  • 三個來源都不是官方 API — 網站改版時解析器需要更新(快照日期過舊時先懷疑這個)。
  • AA 的 Intelligence 與 Arena 的 Elo 量測方式不同,不要跨欄直接比數值大小。
  • NanoGPT 價格是聚合器價,可能與原廠不同(通常更便宜、或按訊息計費的模型會缺價)。
  • 「價差」= (NanoGPT 混合價 − 原廠混合價) ÷ 原廠混合價,負數 = 聚合器較便宜。