Hermes Agent 長上下文 LLM 指南

Hermes Agent 配置 Kimi (Moonshot):128K-1M 長上下文專用

Kimi (Moonshot) 是 Hermes Agent 在國內的長上下文首選 LLM:8K / 32K / 128K / 1M 多檔視窗,適合處理大型程式碼庫、長合同、研究文件對話場景。本文給出 API Key 申請、Hermes 接入命令、模型選擇策略與 5 大實際使用場景。

Hermes Agentv2026.9.14最後更新
  • 🪟 128K 起跳,1M 上下文專用模型覆蓋超長場景
  • 🇨🇳 國內訪問直連 platform.moonshot.cn,無需代理
  • 💰 Kimi-128k 約 0.060 元/千 tokens,Kimi-1M 約 0.20 元/千 tokens
  • 🤝 與 GLM-4 多 Provider 並存,Hermes 按 Skill 自動路由

為什麼用 Kimi

Kimi 由 Moonshot AI 開發,是國內最早把長上下文能力做成賣點的大模型。對 Hermes Agent 使用者來說,它的價值場景非常清晰:當 GLM-4 / Claude 的 128K-200K 視窗被塞滿之後,Kimi-1M 接力。

  • 🪟 1M tokens 上下文:相當於一次塞進 ~75 萬漢字(約 6 本《三體》)。能放下一個完整中型程式碼庫(10-15 萬行)或者 200 頁 PDF。
  • 🔍 長上下文召回準確率:實測 Kimi-1M 在 500K-1M token 範圍的「針刺草堆」(needle-in-haystack)測試中召回準確率 > 95%,明顯優於其他國產模型的「128K 名義但 60K 後明顯衰減」。
  • 🇨🇳 國內訪問穩:moonshot.cn 域名直連,北上深首 token 延遲約 400-500ms。和 GLM 一樣不需要代理。
  • ⚡ Streaming 友好:長輸出場景下 Kimi 的流式響應穩定(少抖動、少斷流),適合 Hermes Gateway 即時回顯場景。

Kimi 不是 GLM 的替代品,而是補充。建議:日常用 GLM-4-Plus,遇到 60K+ 上下文任務切到 Kimi。Hermes 支援多 Provider 同時配置,按需切換。

申請 Moonshot API Key

Moonshot 開放平臺和智譜流程相似,5 分鐘內可以走完。

  1. 1. 註冊 Moonshot 開放平臺

    訪問 https://platform.moonshot.cn → 手機號註冊 → 完成實名認證。企業使用者走「企業認證」可拿更高的 RPM 上限。

  2. 2. 生成並複製 API Key

    登入後 → 賬戶設定 → API Key 管理 → 新建 API Key。複製 Key(形如 sk-xxxxxx)到密碼管理器,Key 僅出現一次。

  3. 3. 充值(可選)

    新使用者送 15 元免費額度。Kimi-128k 輸入約 0.060 元/千 tokens,免費額度大約夠 25 萬 tokens(約一箇中型 PDF)。繼續用需要在「財務中心」充值,最低 10 元起。

建議先用試用額度跑一兩個長上下文任務感受效果,再決定是否充值。

配置 Hermes 使用 Kimi

Hermes 內建 moonshot 介面卡,走官方 OpenAI 相容介面。3 條命令搞定。

hermes config set provider.moonshot.api_key "你的_KIMI_KEY"

寫入 Moonshot Key 到 ~/.hermes/secrets.toml(加密 0600 許可權)。注意雙引號是英文雙引號。

  1. 1. 寫入 API Key

    上面那條命令一跑,Key 就加密落盤,不會出現在 git diff 裡。多 Provider 並存的場景下 Kimi 和 GLM 的 Key 可以同時配置、互不干擾。

  2. 2. 選預設模型

    hermes config set provider.moonshot.model moonshot-v1-128k(推薦:128K 上下文 + 價效比最佳)。如果偶爾需要超長場景再切到 moonshot-v1-1m。

  3. 3. 切到 Kimi 或保持多 Provider

    想全域性切到 Kimi:hermes config set provider moonshot。想保留 GLM 預設、僅在長上下文場景臨時用 Kimi:在 Skill 的 meta.yaml 里加 provider_override: moonshot(詳見 /skills)。

配置完跑 hermes doctor --provider 自檢,5 秒內看到 ✅ 表示通路正常。

模型選擇(8k / 32k / 128k / 1M)

Moonshot 當前對外開放 4 檔模型,按上下文視窗和價格區分。表面看都是 Kimi,效能與價位差異巨大,選錯檔可能多花 10 倍錢。

  • moonshot-v1-8k:8K 上下文,輸入約 0.012 元/千 tokens,輸出 0.012。適合短對話、簡單分類、原型驗證。日常對話場景成本最低。
  • moonshot-v1-32k:32K 上下文,輸入約 0.024 元/千 tokens。適合中等長度文件摘要、幾個檔案的 RAG 召回。
  • moonshot-v1-128k:128K 上下文,輸入約 0.060 元/千 tokens。Hermes Agent 長上下文預設選擇,價效比最佳。能塞下一個 5-8 萬字的專案文件。
  • moonshot-v1-1m(kimi-1m):1M 上下文,輸入約 0.20 元/千 tokens。專用模型,慢且貴但能力強。適合一次性吃下整個程式碼庫或厚合同。需要在控制台「服務開通」頁申請開通。
  • kimi-k1.5(推理增強版):偶爾有限時開放,專門處理複雜推理任務,按使用按量計費。

選型建議:預設 moonshot-v1-128k;只有遇到「單次必須 > 80K」的明確場景才升到 1M。最新價格請以 Moonshot 平臺「計費說明」頁為準 → https://platform.moonshot.cn/docs/pricing 。

長上下文 5 大使用場景

把 Kimi 接入 Hermes 之後,下面 5 類任務是它真正發揮優勢的地方。每條都對應一個 Hermes Agent 內建 / 推薦 Skill。

  • 場景 1 — 大型程式碼庫整體審計:Skill code-audit + Kimi-1M,一次性把 ~10 萬行的專案程式碼全塞進上下文,讓 Agent 找架構問題、迴圈依賴、安全隱患。GLM-4 這種 60K 後衰減的模型在這種場景下表現不穩定。
  • 場景 2 — 長合同 / 法律文件摘要:Skill doc-summarize 配合 Kimi-128k,把 200 頁 PDF(約 30 萬字)丟進去,輸出按章節的摘要 + 關鍵條款風險點。比分段切片再合併的傳統 RAG 準確率高得多。
  • 場景 3 — 研究文件多輪對話:Skill research-chat + Kimi-128k,匯入一組論文(10-20 篇)後保持多輪對話,Agent 能跨論文交叉引用、保持上下文一致性。Hermes Memory 模組可以把這種長會話壓縮到 5K 內重新載入。
  • 場景 4 — Skill 串聯多檔案:Hermes Gateway 在 Kimi 上跑「讀 50 個 yaml 配置 → 生成對比表 → 寫遷移指令碼」這種鏈式任務時,Kimi-128k 不需要在中間步驟切片,整條鏈路一次完成。
  • 場景 5 — 多輪長對話不丟上下文:Hermes Chat 模式下連續 200+ 輪的對話,Kimi 的 128K 配合 Hermes 自動上下文管理,比 GLM-4 / GPT-4o 在 30 輪之後開始遺忘的體驗好得多。

如果你的日常任務都在 60K tokens 以下,沒必要切 Kimi——GLM-4-Plus 更便宜、更快。只在「明確需要長上下文」時拉 Kimi 出來用。

常見報錯

Kimi 日常使用 4 類報錯最常見。挨個排查即可。

  • context_length_exceeded / 上下文超長

    原因 / Cause: 當前對話或單次請求的 token 數超過了選定模型的視窗。比如選了 moonshot-v1-8k 但塞進去 12K 的內容。

    修复 / Fix: 兩個選擇:(a) 升檔:hermes config set provider.moonshot.model moonshot-v1-128k;(b) 壓縮:hermes context summarize 把歷史會話壓縮。如果確實需要 > 128K,切到 moonshot-v1-1m。

  • Model not found / 模型不可用

    原因 / Cause: 賬號沒有開通該模型的訪問許可權。moonshot-v1-1m 預設是「申請制」開通。

    修复 / Fix: Moonshot 控制台 → 服務開通 → 申請開通 1M 模型。稽核通常 1-2 個工作日。如果是 128k 之類的常規模型,確認賬號已實名認證。

  • 401 Invalid API key

    原因 / Cause: Key 複製錯誤、過期、或者在其他賬號下生成。

    修复 / Fix: 重新到控制台生成 Key,跑 hermes config set provider.moonshot.api_key "新KEY"。注意 Moonshot Key 字首是 sk-,不要漏掉。

  • 429 Rate limit / TPM exceeded

    原因 / Cause: Moonshot 按 TPM(tokens per minute)限流,而不只是 RPM。長上下文請求一次就消耗大量 TPM,更容易撞牆。

    修复 / Fix: 到控制台「賬戶中心」→「速率限制」檢視當前 TPM 上限並申請提升。臨時方案:hermes config set llm.moonshot.concurrent 1 序列化請求,等業務量上來再付費提額。

下一步

回到 GLM 主指南

GLM-4 是日常 / 短上下文場景首選,與 Kimi 多 Provider 並存。

看 GLM 配置

Skills 系統指南

bundled and community Skills + Skills Hub,與 Kimi 長上下文搭配的最佳實踐。

看 Skills

CLI 完整命令參考

hermes config / context / gateway 等 50+ 命令分類速查。

看 CLI 手冊

回到主文件

與 v2026.9.14 同步的完整中文文件,含 Memory / Gateway / Multi-Provider 章節。

主文件