如何在 Glows.ai 執行 GPT-OSS-20B 與 GPT-OSS-120B
本教學說明如何在 Glows.ai 租用 NVIDIA GeForce RTX 4090 GPU,執行 gpt-oss-20b。相同方法也適用於在 NVIDIA H100 SXM5 上執行 gpt-oss-120b。
內容包括:
- 在 Glows.ai 建立執行個體
- 使用 gpt-oss-20b
- 與其他人共用存取權
- 透過 API 呼叫 gpt-oss-20b
- 使用 Auto Deploy 建立「隨需啟動」的執行個體
GPT-OSS-20B 是 OpenAI 於 2025 年 8 月發布的開放原始碼大型語言模型,約有 210 億個參數。它採用 **Mixture-of-Experts(MoE)**架構,每個 token 只會啟用約 36 億個參數,因此能降低推論所需資源。此模型支援本機部署,針對 MoE 層進行效能最佳化,僅需 16GB GPU 記憶體即可執行。官方基準測試顯示,它在數項常見測試中的效能接近 OpenAI o3-mini。

建立執行個體
依照此指南在 Glows.ai 建立隨需執行個體。請選擇官方預先設定的 GPT OSS 20B 映像檔(img-neqm8dp2)。
在 Create New 頁面,將 Workload Type 設為 Inference GPU -- 4090,並選擇 GPT OSS 20B 映像檔。此映像檔包含必要的執行環境,並已啟動 Ollama(監聽連接埠 11434)與 OpenWebUI(監聽連接埠 8080)。

Datadrive 是 Glows.ai 的雲端儲存服務,可在建立執行個體前上傳資料、模型與程式碼。建立執行個體時點選 Mount,即可掛載 Datadrive 並直接存取。
本教學只進行推論,因此不需要掛載 Datadrive。
完成設定後,點選右下角的 Complete Checkout 建立執行個體。

GPT OSS 20B 執行個體約需 30–60 秒啟動。啟動後,可在 My Instances 查看狀態與存取連結:
- SSH Port 22:SSH 連線
- HTTP Port 8888:JupyterLab
- HTTP Port 11434:Ollama API
- HTTP Port 8080:OpenWebUI

使用 GPT OSS 20B
前往 My Instances 頁面,點選 HTTP Port 8080 下方的 Open,開啟 Open WebUI 服務。第一次使用時,需要建立管理員帳號。

建立帳號後即可進入聊天介面,直接與 gpt-oss-20b 模型互動。

Open WebUI 也會根據目前對話提供後續問題建議。

與其他人共用
OpenWebUI 內建帳號管理系統,可分隔不同使用者的對話。依序點選左上角選單 → 左下角頭像 → Admin Panel。

點選 Settings,將 Default User Role 設為 user,啟用 New Sign Ups,再點選 Save。

將 My Instances 中的 HTTP Port 8080 連結分享給其他人。他們可以在瀏覽器開啟連結,點選 Sign up 建立帳號。

使用者註冊後,管理員可以在 Admin Panel 查看帳號與問題紀錄。

透過 API 呼叫 GPT OSS 20B
若要以程式呼叫 GPT-OSS-20B,請啟用 API 服務。
在 Admin Panel → Settings 中向下捲動,啟用 Enable API Key,再點選 Save。

在個人帳號中前往 Settings → Account,查看或建立 API key。請妥善保存此金鑰,後續 Auto Deploy 範例會使用它。

取得 API key 後,即可依下列方式傳送請求。API endpoint 格式:
API Endpoint = HTTP Port 8080 link + /api/chat/completions
Example: https:/tw-05.access.glows.ai:25947/api/chat/completions
請求範例:
curl -X POST https:/tw-05.access.glows.ai:25947/api/chat/completions \
-H "Authorization: Bearer sk-f9xxxxxxxxxxxx0" \
-H "Content-Type: application/json" \
-d '{
"messages": [
{
"role": "user",
"content": "I just started college and want to learn Python artificial intelligence. Please help me plan my study content."
}
],
"model": "gpt-oss:20b",
"temperature": 0.7
}'
模型會在推論完成後回傳結果。

也可以使用 OpenAI 的 Python SDK:
import openai
client = openai.Client(
base_url="https:/tw-06.access.glows.ai:25947/api", api_key="sk-f9xxxxxxxxxxxx0")
# Chat completion
response = client.chat.completions.create(
model="gpt-oss:20b",
messages=[
{"role": "system", "content": "You are a helpful AI assistant"},
{"role": "user", "content": "Tell me which is bigger, 9.11 or 9.8"},
],
temperature=0.6
)
print(response)

進階用法:Auto Deploy
傳統 GPU 部署需要手動建立及釋放執行個體,不適合低頻率使用或提供第三方 API 存取。
Glows.ai Auto Deploy 會提供固定的服務連結。連結收到請求時,Glows.ai 會建立執行個體並處理請求;5 分鐘內沒有新請求時,系統會自動釋放執行個體,達到「隨需啟動」。
建立快照
若要保留 API key 與環境設定,請在 Glows.ai 點選 Take Snapshot 建立快照。

輸入快照名稱,並選擇 automatically released,讓系統在快照建立後釋放執行個體。

如果尚未購買儲存空間,Glows.ai 會將快照存放在 Snapshots → Restorable。本教學的快照很小,你可以在 Storage Space 以每月 $0.5 購買 5GB 儲存方案,並分配 1GB 給快照。接著在 Snapshots 中將快照移至 Available。

設定 Auto Deploy
前往 Auto Deploy → New Deploy,建立設定並輸入方便辨識的名稱。

選擇 GPU 與環境。你可以使用快照或系統映像檔;此處選擇剛才建立的快照。

設定服務連接埠與啟動命令。本例中的 Open WebUI 會在連接埠 8080 自動啟動,因此只需設定連接埠。
Port: 8080
點選 Confirm 完成設定。
查看設定
設定完成後,頁面會顯示固定連結與設定詳細資料。

呼叫 Auto Deploy 連結
將 API endpoint 換成 Auto Deploy 連結,並在 Authorization 中加入 API key:
curl -X POST https:/tw-05.sgw.glxxxxxx224w/api/chat/completions \
-H "Authorization: Bearer sk-f9xxxxxxxxxxxx0" \
-H "Content-Type: application/json" \
-d '{
"messages": [
{
"role": "user",
"content": "I just started college and want to learn Python artificial intelligence. Please help me plan my study content."
}
],
"model": "gpt-oss:20b",
"temperature": 0.7
}'

5 分鐘內沒有新請求時,系統會自動釋放執行個體。Auto Deploy 也會顯示總費用與 Instance Status:
- Standby:設定正常,尚未啟動執行個體。
- Idle:已收到請求,正在建立執行個體;或正在自動釋放執行個體。
- Running:執行個體正在處理請求;閒置 5 分鐘後會自動釋放。
若要大規模使用,請聯絡 Glows.ai 預先快取映像檔或快照,加快執行個體啟動速度。
聯絡我們
使用 Glows.ai 時若有問題或建議,請透過以下方式聯絡我們:
- Email: support@glows.ai
- Line link: https://lin.ee/fHcoDgG