Hermes Agent 國內 LLM Provider 指南

Hermes Agent 配置智譜 GLM-4(2026 完整教程)

智譜 GLM-4 是 Hermes Agent 國內最快的 LLM 選項:3 步配置完成、新使用者 18 元試用額度、API 價格低於 GPT-4 一個數量級、與 Claude/GPT 效能對比、國內訪問無需代理。本文同步 v2026.9.14 與 GLM-4-Plus / Air / Flash 三檔模型最新接入方式。

Hermes Agentv2026.9.14最後更新
  • ⏱ 3 步配置完成,整體不到 5 分鐘
  • 💰 GLM-4-Air 約 0.001 元/千 tokens,比 GPT-4o 便宜 50 倍
  • 🇨🇳 國內訪問直連,不需要代理、不需要科學上網
  • 🧰 與 bundled and community Skills 全相容,支援函式呼叫 / JSON 模式 / Streaming

為什麼選 GLM-4

智譜 AI 是國內做得最早、最穩的大模型 API 平臺之一(清華系),GLM-4 是當前他們對外開放的主力閉源模型。對 Hermes Agent 國內使用者來說,它解決了三個最痛的問題:

  • 🚀 國內訪問延遲低:直連開放平臺 open.bigmodel.cn,無需代理。北京 / 上海 / 深圳實測首 token 延遲 < 400ms,整體比走 Claude 中轉快 3-5 倍。
  • 💸 價格便宜一個數量級:GLM-4-Air 輸入約 0.0005 元/千 tokens,GLM-4-Flash 直接免費(限額度內)。同等任務月成本通常只是 GPT-4o 的 5%-10%。
  • 🔧 工具呼叫穩:GLM-4-Plus 在 Hermes Skills 呼叫場景下的函式呼叫準確率與 GPT-4o-2024-08 持平,並明顯高於國內其他開源模型。
  • ✅ 合規友好:智譜透過國家網信辦大模型備案,企業場景上線不再卡合規。

簡而言之:如果你的 Hermes Agent 主要在國內跑,且關心賬單 + 網路穩定性,GLM-4 是當前最划算的預設選擇。

準備工作(賬號 + API Key)

配置 GLM 之前要拿到一個能用的 API Key。流程在 5 分鐘之內可以完成。

  1. 1. 註冊智譜開放平臺

    訪問 https://open.bigmodel.cn → 手機號註冊 → 完成實名認證(個人 / 企業都行)。實名是必須的,不實名不能領試用額度。

  2. 2. 建立並複製 API Key

    登入後進 控制台 → API 管理 → 建立 API Key。複製 Key 到剪貼簿(形如 abcdef123456.xyz)。Key 只顯示一次,請立刻儲存到 1Password / 系統鑰匙串。

  3. 3. 確認 Hermes 版本 ≥ v0.9.5

    GLM Provider 原生支援是 v0.9.5 引入的。終端跑 hermes --version 確認。版本低的先 hermes update(詳見 /install)。

準備就緒。下一節直接 3 步把 GLM 接入 Hermes。

三步配置 Hermes 使用 GLM

配置檔案在 ~/.hermes/config.toml,但你不用手動編輯,全部用 CLI 完成。

hermes config set provider zhipu

把預設 LLM Provider 切到智譜。Hermes 內建 zhipu 介面卡,直接走官方 OpenAI 相容介面。

  1. 1. 切換 Provider

    上面那條命令一跑,~/.hermes/config.toml 裡的 [llm].provider 欄位會改成 zhipu,並在 [llm.zhipu] 節佔好位。

  2. 2. 寫入 API Key

    跑 hermes config set provider.zhipu.api_key "你的_API_KEY"(注意雙引號,Key 裡可能有點號)。Key 會加密存到 ~/.hermes/secrets.toml,許可權 0600,不會被 git 誤傳。

  3. 3. 選模型 + 自檢

    hermes config set provider.zhipu.model glm-4-plus(推薦:能力最強)。然後跑 hermes doctor --provider 驗證:指令碼會發一個 ping 請求,5 秒內返回 ✅ 表示通路正常。

裝完直接 hermes 啟動 Agent,跑任何任務就會走 GLM。下一節講三檔模型怎麼選、要花多少錢。

API 計費與新使用者額度

智譜按 token 計費,輸入和輸出分別按價。當前主流三檔模型適合的場景與價格如下(2026-05 資料):

  • GLM-4-Plus:能力最強,對標 GPT-4o。輸入 0.05 元/千 tokens,輸出 0.05 元/千 tokens。上下文 128K。適合複雜任務、程式碼生成、資料分析。
  • GLM-4-Air:價效比之王。輸入 0.0005 元/千 tokens,輸出 0.0005 元/千 tokens(相當於 GLM-4-Plus 的 1%)。上下文 128K。適合大批次、文本處理、日常對話。
  • GLM-4-Flash:完全免費(限額度內)。輸入輸出均 0 元/千 tokens。響應速度快但能力略弱。適合純文本任務、原型驗證、個人 demo。
  • 新使用者試用:實名認證後送 18 元免費額度(約夠 GLM-4-Plus 跑 36 萬 tokens,或 GLM-4-Air 跑 3600 萬 tokens)。在 Hermes Agent 日常任務裡可以撐 2-4 周。
  • 充值起步:最低 10 元,支付寶 / 微信 / 公司對公轉賬都行。預付費扣到 0 自動停服,不會欠費。

上面的數字會隨智譜定價策略調整,最新價格請以智譜開放平臺「價格說明」頁為準 → https://open.bigmodel.cn/pricing 。Hermes Agent 不參與計費,所有費用直接結算到智譜賬戶。

效能與場景對比

GLM-4 vs Claude / GPT-4 / Kimi 在 Hermes Agent 實際場景的對比。資料基於 Hermes 團隊 2026-04 在國內 4 臺機器上的實測(每條任務跑 50 次取均值),僅供選型參考。

  • 響應延遲(北京 → API → 首 token):GLM-4-Plus 350-450ms,Kimi 400-500ms,Claude(直連)2-5s,GPT-4o(直連)3-8s。國內場景 GLM 完勝。
  • 上下文視窗:GLM-4-Plus 128K,GLM-4-Air 128K,Kimi-128k 128K,Kimi-1M(長上下文專用)1M,GPT-4o 128K,Claude 3.7 Sonnet 200K。
  • 函式呼叫準確率(Hermes Skills 實測):GLM-4-Plus 92%,GPT-4o 94%,Claude 3.7 Sonnet 96%,Kimi-128k 87%。GLM 排第三,已經夠日常用。
  • 中文理解:GLM-4-Plus ≥ Kimi > Claude > GPT-4o。GLM 團隊是清華系,中文語料質量最好,對國內俚語和專業領域中文識別明顯佔優。
  • 英文程式碼生成:Claude 3.7 Sonnet > GPT-4o > GLM-4-Plus > Kimi。涉及大量英文文件 / 複雜程式碼生成的任務,Claude 仍是首選。
  • 同任務月度賬單(連續 50 次「列 Python 專案所有依賴並歸類」任務):GLM-4-Air 約 0.3 元,GLM-4-Plus 約 4 元,Kimi-128k 約 2 元,GPT-4o(含代理流量)約 80 元。

結論:日常 + 國內場景用 GLM-4-Plus 或 Air;需要超長上下文(>200K)用 Kimi;寫大量英文程式碼 + 預算充足用 Claude。Hermes 支援多 Provider 共存,按 Skill 切換詳見 /docs。

最佳實踐(Skills / 溫度 / 併發)

把 GLM 接入 Hermes 之後,下面 4 條經驗能讓你少踩坑、賬單可控、效果更好。

  • Skills 預設溫度:GLM-4 的最佳推理溫度在 0.3-0.5 之間(低於 GPT-4o 的 0.7 預設)。在 hermes config set llm.temperature 0.4 設定全域性預設,或者在具體 Skill 的 meta.yaml 裡覆蓋。
  • 長任務用 Air,短互動用 Plus:批次分類 / 資料清洗 / RAG 召回這類大量、低複雜度任務全開 Air;程式碼生成 / 決策推理 / 工具呼叫切到 Plus。在 ~/.hermes/config.toml 的 [llm.zhipu] 裡設 model_fast = "glm-4-air",model_smart = "glm-4-plus",Hermes 會按 Skill 標籤自動選。
  • 併發限流:智譜免費層 RPM = 5(5 次請求/分鐘);付費使用者預設 RPM = 60,可工單申請提到 600+。Hermes Gateway 模式下併發任務多時,先去開放平臺後臺調高 RPM,否則會頻繁 429。
  • 上下文視窗管理:GLM-4 128K 不等於「隨便塞」。實測 token 數 > 60K 時 GLM 會有明顯的「中段遺忘」(middle-loss)。長文件場景建議 chunked summarize,或者改用 Kimi-1M(詳見 /providers/kimi)。

配合 Hermes Memory 模組(詳見 /docs#memory)使用,可以把高頻上下文壓縮到 5K 以內,長會話場景下賬單能再降 60%。

常見報錯排查

日常使用中遇到 GLM 報錯,90% 是下面 5 類。挨個對照即可。

  • 401 Unauthorized / Invalid API key

    原因 / Cause: API Key 複製時多了空格、引號、換行;或 Key 沒有從對應賬號生成;或長時間不用被自動停用。

    修复 / Fix: 到開放平臺後臺重新建立一個 Key,跑 hermes config set provider.zhipu.api_key "新KEY"。注意雙引號是英文引號、Key 不要帶任何前後空格。

  • 429 Too Many Requests / Rate limit exceeded

    原因 / Cause: RPM(每分鐘請求數)超限。免費使用者 5 RPM 很快就撞牆,Gateway 模式下併發任務尤其容易。

    修复 / Fix: 短期:在 Hermes 里加全侷限流:hermes config set llm.zhipu.rpm 4(留 1 個 buffer)。長期:到開放平臺後臺 → API 管理 → 提工單申請提 RPM,付費使用者一般 24 小時內拉到 600。

  • Insufficient balance / 賬戶餘額不足

    原因 / Cause: 試用額度耗光或預付費扣到 0。

    修复 / Fix: 開放平臺「賬戶中心」→「我的賬戶」→「充值」。建議留 50 元緩衝,避免半夜跑長任務時停服。可設餘額低於 10 元郵件告警。

  • Model not found: glm-4-plus / glm-4-air

    原因 / Cause: 模型名拼錯;或者你的賬號還沒有這個模型的訪問許可權(部分新模型預設不開放)。

    修复 / Fix: 到 https://open.bigmodel.cn/dev/api 看當前你賬號可用的模型 ID 列表,複製到 hermes config set provider.zhipu.model <正確ID>。GLM-4-Flash 偶爾需要在「開通服務」頁手動開通。

  • Timeout after 60s / 上下文超長

    原因 / Cause: 128K 上下文塞太滿,模型推理超時;或者網路中轉抖動。

    修复 / Fix: 先 hermes context summarize 壓縮當前會話;如果是非 RAG 場景大文件,改用流式輸出 hermes config set llm.zhipu.stream true。仍超時考慮切到 Kimi-128k,詳見 /providers/kimi。

下一步

Kimi 長上下文專用配置

Kimi-1M 處理大型程式碼庫 / 長合同 / 研究文件場景,與 GLM 共存。

看 Kimi 配置

bundled and community Skills 全景圖

Hermes Skills 系統:Skills Hub、自學習機制、與 GLM 函式呼叫配合。

看 Skills 指南

CLI 完整命令參考

hermes config / hermes skills / hermes gateway 等 50+ 命令分類速查。

看 CLI 手冊

回到主文件

與 v2026.9.14 同步的完整中文文件,含安裝、Skills、Memory、Gateway。

主文件