🔥 L40s Server Is Now Live – Just 0.83 credits/hr!

如何測試 LLM 的延遲與吞吐量

教學

如何測試 LLM 的延遲與吞吐量

基準測試不是宣稱「很快」,而是用可重現的測量回答是否符合使用者需求。請固定模型 revision、GPU、地區、推論引擎、輸入集與併發數。

最低限度要記錄的指標

  • time to first token(TTFT)
  • 端到端延遲與 p50/p95/p99
  • 每秒輸出 token、總 token/秒、成功率
  • 併發數、輸入/輸出 token 數與排隊時間
  • GPU 使用率、VRAM、模型、runtime 與地區

只測短的單一請求,無法證明正式環境品質。warm-up 後用代表性輸入重複測量,並在多個併發等級下測試。失敗、timeout、截斷與品質下降同樣是結果。

先定義目標,例如「p95 低於 X 秒、成功率高於 Y%、通過品質評估」,不要把條件不同的測試混在一起比較。

Glows.ai
所有服務運作正常
ISO/IEC 27001:2022 Certified
  • Twitter
  • Github
  • Discord
© 2025 Glows.ai-版權所有