🔥 L40s Server Is Now Live – Just 0.83 credits/hr!

如何在 Glows.ai 執行 GPT-OSS-20B 與 GPT-OSS-120B

教學

本教學說明如何在 Glows.ai 租用 NVIDIA GeForce RTX 4090 GPU,執行 gpt-oss-20b。相同方法也適用於在 NVIDIA H100 SXM5 上執行 gpt-oss-120b

內容包括:

  • 在 Glows.ai 建立執行個體
  • 使用 gpt-oss-20b
  • 與其他人共用存取權
  • 透過 API 呼叫 gpt-oss-20b
  • 使用 Auto Deploy 建立「隨需啟動」的執行個體

GPT-OSS-20B 是 OpenAI 於 2025 年 8 月發布的開放原始碼大型語言模型,約有 210 億個參數。它採用 **Mixture-of-Experts(MoE)**架構,每個 token 只會啟用約 36 億個參數,因此能降低推論所需資源。此模型支援本機部署,針對 MoE 層進行效能最佳化,僅需 16GB GPU 記憶體即可執行。官方基準測試顯示,它在數項常見測試中的效能接近 OpenAI o3-mini

image-20250811161540192

建立執行個體

依照此指南在 Glows.ai 建立隨需執行個體。請選擇官方預先設定的 GPT OSS 20B 映像檔(img-neqm8dp2)。

Create New 頁面,將 Workload Type 設為 Inference GPU -- 4090,並選擇 GPT OSS 20B 映像檔。此映像檔包含必要的執行環境,並已啟動 Ollama(監聽連接埠 11434)與 OpenWebUI(監聽連接埠 8080)。

image-20250811142101261

Datadrive 是 Glows.ai 的雲端儲存服務,可在建立執行個體前上傳資料、模型與程式碼。建立執行個體時點選 Mount,即可掛載 Datadrive 並直接存取。

本教學只進行推論,因此不需要掛載 Datadrive。

完成設定後,點選右下角的 Complete Checkout 建立執行個體。

image-20250811142313589

GPT OSS 20B 執行個體約需 30–60 秒啟動。啟動後,可在 My Instances 查看狀態與存取連結:

  • SSH Port 22:SSH 連線
  • HTTP Port 8888:JupyterLab
  • HTTP Port 11434:Ollama API
  • HTTP Port 8080:OpenWebUI

image-20250811142452011

使用 GPT OSS 20B

前往 My Instances 頁面,點選 HTTP Port 8080 下方的 Open,開啟 Open WebUI 服務。第一次使用時,需要建立管理員帳號。

image-20250811142719474

建立帳號後即可進入聊天介面,直接與 gpt-oss-20b 模型互動。

image-20250811143014826

Open WebUI 也會根據目前對話提供後續問題建議。

image-20250811150602422

與其他人共用

OpenWebUI 內建帳號管理系統,可分隔不同使用者的對話。依序點選左上角選單 → 左下角頭像 → Admin Panel

image-20250811143426787

點選 Settings,將 Default User Role 設為 user,啟用 New Sign Ups,再點選 Save

image-20250811144203704

My Instances 中的 HTTP Port 8080 連結分享給其他人。他們可以在瀏覽器開啟連結,點選 Sign up 建立帳號。

image-20250811144249486

使用者註冊後,管理員可以在 Admin Panel 查看帳號與問題紀錄。

image-20250811144448371

透過 API 呼叫 GPT OSS 20B

若要以程式呼叫 GPT-OSS-20B,請啟用 API 服務。

Admin PanelSettings 中向下捲動,啟用 Enable API Key,再點選 Save

image-20250811144752670

在個人帳號中前往 SettingsAccount,查看或建立 API key。請妥善保存此金鑰,後續 Auto Deploy 範例會使用它。

image-20250811144841124 image-20250811144912480

取得 API key 後,即可依下列方式傳送請求。API endpoint 格式:

bash
API Endpoint = HTTP Port 8080 link + /api/chat/completions
Example: https:/tw-05.access.glows.ai:25947/api/chat/completions

請求範例:

bash
curl -X POST https:/tw-05.access.glows.ai:25947/api/chat/completions \
  -H "Authorization: Bearer sk-f9xxxxxxxxxxxx0" \
  -H "Content-Type: application/json" \
  -d '{
        "messages": [
          {
            "role": "user",
            "content": "I just started college and want to learn Python artificial intelligence. Please help me plan my study content."
          }
        ],
        "model": "gpt-oss:20b",
        "temperature": 0.7
      }'

模型會在推論完成後回傳結果。

image-20250811150332264

也可以使用 OpenAI 的 Python SDK:

python
import openai
client = openai.Client(
    base_url="https:/tw-06.access.glows.ai:25947/api", api_key="sk-f9xxxxxxxxxxxx0")

# Chat completion
response = client.chat.completions.create(
    model="gpt-oss:20b",
    messages=[
        {"role": "system", "content": "You are a helpful AI assistant"},
        {"role": "user", "content": "Tell me which is bigger, 9.11 or 9.8"},
    ],
    temperature=0.6
)
print(response)

image-20250811170502665

進階用法:Auto Deploy

傳統 GPU 部署需要手動建立及釋放執行個體,不適合低頻率使用或提供第三方 API 存取。

Glows.ai Auto Deploy 會提供固定的服務連結。連結收到請求時,Glows.ai 會建立執行個體並處理請求;5 分鐘內沒有新請求時,系統會自動釋放執行個體,達到「隨需啟動」。

建立快照

若要保留 API key 與環境設定,請在 Glows.ai 點選 Take Snapshot 建立快照。

image-20250811170732162

輸入快照名稱,並選擇 automatically released,讓系統在快照建立後釋放執行個體。

image-20250811170845190

如果尚未購買儲存空間,Glows.ai 會將快照存放在 Snapshots → Restorable。本教學的快照很小,你可以在 Storage Space 以每月 $0.5 購買 5GB 儲存方案,並分配 1GB 給快照。接著在 Snapshots 中將快照移至 Available

image-20250811171559043

設定 Auto Deploy

前往 Auto DeployNew Deploy,建立設定並輸入方便辨識的名稱。

image-20250811171843622

選擇 GPU 與環境。你可以使用快照或系統映像檔;此處選擇剛才建立的快照。

image-20250811171948063

設定服務連接埠與啟動命令。本例中的 Open WebUI 會在連接埠 8080 自動啟動,因此只需設定連接埠。

bash
Port: 8080

image-20250811172106189 點選 Confirm 完成設定。

查看設定

設定完成後,頁面會顯示固定連結與設定詳細資料。

image-20250811172148517

呼叫 Auto Deploy 連結

將 API endpoint 換成 Auto Deploy 連結,並在 Authorization 中加入 API key:

bash
curl -X POST https:/tw-05.sgw.glxxxxxx224w/api/chat/completions \
  -H "Authorization: Bearer sk-f9xxxxxxxxxxxx0" \
  -H "Content-Type: application/json" \
  -d '{
        "messages": [
          {
            "role": "user",
            "content": "I just started college and want to learn Python artificial intelligence. Please help me plan my study content."
          }
        ],
        "model": "gpt-oss:20b",
        "temperature": 0.7
      }'

image-20250811173542494

5 分鐘內沒有新請求時,系統會自動釋放執行個體。Auto Deploy 也會顯示總費用與 Instance Status

  • Standby:設定正常,尚未啟動執行個體。
  • Idle:已收到請求,正在建立執行個體;或正在自動釋放執行個體。
  • Running:執行個體正在處理請求;閒置 5 分鐘後會自動釋放。

若要大規模使用,請聯絡 Glows.ai 預先快取映像檔或快照,加快執行個體啟動速度。

聯絡我們

使用 Glows.ai 時若有問題或建議,請透過以下方式聯絡我們:

Glows.ai
所有服務運作正常
ISO/IEC 27001:2022 Certified
  • Twitter
  • Github
  • Discord
© 2025 Glows.ai-版權所有