Hermes Agent 国内 LLM Provider 指南

Hermes Agent 配置智谱 GLM-4(2026 完整教程)

智谱 GLM-4 是 Hermes Agent 国内最快的 LLM 选项:3 步配置完成、新用户 18 元试用额度、API 价格低于 GPT-4 一个数量级、与 Claude/GPT 性能对比、国内访问无需代理。本文同步 v2026.9.14 与 GLM-4-Plus / Air / Flash 三档模型最新接入方式。

Hermes Agentv2026.9.14最后更新
  • ⏱ 3 步配置完成,整体不到 5 分钟
  • 💰 GLM-4-Air 约 0.001 元/千 tokens,比 GPT-4o 便宜 50 倍
  • 🇨🇳 国内访问直连,不需要代理、不需要科学上网
  • 🧰 与 bundled and community Skills 全兼容,支持函数调用 / JSON 模式 / Streaming

为什么选 GLM-4

智谱 AI 是国内做得最早、最稳的大模型 API 平台之一(清华系),GLM-4 是当前他们对外开放的主力闭源模型。对 Hermes Agent 国内用户来说,它解决了三个最痛的问题:

  • 🚀 国内访问延迟低:直连开放平台 open.bigmodel.cn,无需代理。北京 / 上海 / 深圳实测首 token 延迟 < 400ms,整体比走 Claude 中转快 3-5 倍。
  • 💸 价格便宜一个数量级:GLM-4-Air 输入约 0.0005 元/千 tokens,GLM-4-Flash 直接免费(限额度内)。同等任务月成本通常只是 GPT-4o 的 5%-10%。
  • 🔧 工具调用稳:GLM-4-Plus 在 Hermes Skills 调用场景下的函数调用准确率与 GPT-4o-2024-08 持平,并明显高于国内其他开源模型。
  • ✅ 合规友好:智谱通过国家网信办大模型备案,企业场景上线不再卡合规。

简而言之:如果你的 Hermes Agent 主要在国内跑,且关心账单 + 网络稳定性,GLM-4 是当前最划算的默认选择。

准备工作(账号 + API Key)

配置 GLM 之前要拿到一个能用的 API Key。流程在 5 分钟之内可以完成。

  1. 1. 注册智谱开放平台

    访问 https://open.bigmodel.cn → 手机号注册 → 完成实名认证(个人 / 企业都行)。实名是必须的,不实名不能领试用额度。

  2. 2. 创建并复制 API Key

    登录后进 控制台 → API 管理 → 创建 API Key。复制 Key 到剪贴板(形如 abcdef123456.xyz)。Key 只显示一次,请立刻保存到 1Password / 系统钥匙串。

  3. 3. 确认 Hermes 版本 ≥ v0.9.5

    GLM Provider 原生支持是 v0.9.5 引入的。终端跑 hermes --version 确认。版本低的先 hermes update(详见 /install)。

准备就绪。下一节直接 3 步把 GLM 接入 Hermes。

三步配置 Hermes 使用 GLM

配置文件在 ~/.hermes/config.toml,但你不用手动编辑,全部用 CLI 完成。

hermes config set provider zhipu

把默认 LLM Provider 切到智谱。Hermes 内置 zhipu 适配器,直接走官方 OpenAI 兼容接口。

  1. 1. 切换 Provider

    上面那条命令一跑,~/.hermes/config.toml 里的 [llm].provider 字段会改成 zhipu,并在 [llm.zhipu] 节占好位。

  2. 2. 写入 API Key

    跑 hermes config set provider.zhipu.api_key "你的_API_KEY"(注意双引号,Key 里可能有点号)。Key 会加密存到 ~/.hermes/secrets.toml,权限 0600,不会被 git 误传。

  3. 3. 选模型 + 自检

    hermes config set provider.zhipu.model glm-4-plus(推荐:能力最强)。然后跑 hermes doctor --provider 验证:脚本会发一个 ping 请求,5 秒内返回 ✅ 表示通路正常。

装完直接 hermes 启动 Agent,跑任何任务就会走 GLM。下一节讲三档模型怎么选、要花多少钱。

API 计费与新用户额度

智谱按 token 计费,输入和输出分别按价。当前主流三档模型适合的场景与价格如下(2026-05 数据):

  • GLM-4-Plus:能力最强,对标 GPT-4o。输入 0.05 元/千 tokens,输出 0.05 元/千 tokens。上下文 128K。适合复杂任务、代码生成、数据分析。
  • GLM-4-Air:性价比之王。输入 0.0005 元/千 tokens,输出 0.0005 元/千 tokens(相当于 GLM-4-Plus 的 1%)。上下文 128K。适合大批量、文本处理、日常对话。
  • GLM-4-Flash:完全免费(限额度内)。输入输出均 0 元/千 tokens。响应速度快但能力略弱。适合纯文本任务、原型验证、个人 demo。
  • 新用户试用:实名认证后送 18 元免费额度(约够 GLM-4-Plus 跑 36 万 tokens,或 GLM-4-Air 跑 3600 万 tokens)。在 Hermes Agent 日常任务里可以撑 2-4 周。
  • 充值起步:最低 10 元,支付宝 / 微信 / 公司对公转账都行。预付费扣到 0 自动停服,不会欠费。

上面的数字会随智谱定价策略调整,最新价格请以智谱开放平台「价格说明」页为准 → https://open.bigmodel.cn/pricing 。Hermes Agent 不参与计费,所有费用直接结算到智谱账户。

性能与场景对比

GLM-4 vs Claude / GPT-4 / Kimi 在 Hermes Agent 实际场景的对比。数据基于 Hermes 团队 2026-04 在国内 4 台机器上的实测(每条任务跑 50 次取均值),仅供选型参考。

  • 响应延迟(北京 → API → 首 token):GLM-4-Plus 350-450ms,Kimi 400-500ms,Claude(直连)2-5s,GPT-4o(直连)3-8s。国内场景 GLM 完胜。
  • 上下文窗口:GLM-4-Plus 128K,GLM-4-Air 128K,Kimi-128k 128K,Kimi-1M(长上下文专用)1M,GPT-4o 128K,Claude 3.7 Sonnet 200K。
  • 函数调用准确率(Hermes Skills 实测):GLM-4-Plus 92%,GPT-4o 94%,Claude 3.7 Sonnet 96%,Kimi-128k 87%。GLM 排第三,已经够日常用。
  • 中文理解:GLM-4-Plus ≥ Kimi > Claude > GPT-4o。GLM 团队是清华系,中文语料质量最好,对国内俚语和专业领域中文识别明显占优。
  • 英文代码生成:Claude 3.7 Sonnet > GPT-4o > GLM-4-Plus > Kimi。涉及大量英文文档 / 复杂代码生成的任务,Claude 仍是首选。
  • 同任务月度账单(连续 50 次「列 Python 项目所有依赖并归类」任务):GLM-4-Air 约 0.3 元,GLM-4-Plus 约 4 元,Kimi-128k 约 2 元,GPT-4o(含代理流量)约 80 元。

结论:日常 + 国内场景用 GLM-4-Plus 或 Air;需要超长上下文(>200K)用 Kimi;写大量英文代码 + 预算充足用 Claude。Hermes 支持多 Provider 共存,按 Skill 切换详见 /docs。

最佳实践(Skills / 温度 / 并发)

把 GLM 接入 Hermes 之后,下面 4 条经验能让你少踩坑、账单可控、效果更好。

  • Skills 默认温度:GLM-4 的最佳推理温度在 0.3-0.5 之间(低于 GPT-4o 的 0.7 默认)。在 hermes config set llm.temperature 0.4 设置全局默认,或者在具体 Skill 的 meta.yaml 里覆盖。
  • 长任务用 Air,短交互用 Plus:批量分类 / 数据清洗 / RAG 召回这类大量、低复杂度任务全开 Air;代码生成 / 决策推理 / 工具调用切到 Plus。在 ~/.hermes/config.toml 的 [llm.zhipu] 里设 model_fast = "glm-4-air",model_smart = "glm-4-plus",Hermes 会按 Skill 标签自动选。
  • 并发限流:智谱免费层 RPM = 5(5 次请求/分钟);付费用户默认 RPM = 60,可工单申请提到 600+。Hermes Gateway 模式下并发任务多时,先去开放平台后台调高 RPM,否则会频繁 429。
  • 上下文窗口管理:GLM-4 128K 不等于「随便塞」。实测 token 数 > 60K 时 GLM 会有明显的「中段遗忘」(middle-loss)。长文档场景建议 chunked summarize,或者改用 Kimi-1M(详见 /providers/kimi)。

配合 Hermes Memory 模块(详见 /docs#memory)使用,可以把高频上下文压缩到 5K 以内,长会话场景下账单能再降 60%。

常见报错排查

日常使用中遇到 GLM 报错,90% 是下面 5 类。挨个对照即可。

  • 401 Unauthorized / Invalid API key

    原因 / Cause: API Key 复制时多了空格、引号、换行;或 Key 没有从对应账号生成;或长时间不用被自动禁用。

    修复 / Fix: 到开放平台后台重新创建一个 Key,跑 hermes config set provider.zhipu.api_key "新KEY"。注意双引号是英文引号、Key 不要带任何前后空格。

  • 429 Too Many Requests / Rate limit exceeded

    原因 / Cause: RPM(每分钟请求数)超限。免费用户 5 RPM 很快就撞墙,Gateway 模式下并发任务尤其容易。

    修复 / Fix: 短期:在 Hermes 里加全局限流:hermes config set llm.zhipu.rpm 4(留 1 个 buffer)。长期:到开放平台后台 → API 管理 → 提工单申请提 RPM,付费用户一般 24 小时内拉到 600。

  • Insufficient balance / 账户余额不足

    原因 / Cause: 试用额度耗光或预付费扣到 0。

    修复 / Fix: 开放平台「账户中心」→「我的账户」→「充值」。建议留 50 元缓冲,避免半夜跑长任务时停服。可设余额低于 10 元邮件告警。

  • Model not found: glm-4-plus / glm-4-air

    原因 / Cause: 模型名拼错;或者你的账号还没有这个模型的访问权限(部分新模型默认不开放)。

    修复 / Fix: 到 https://open.bigmodel.cn/dev/api 看当前你账号可用的模型 ID 列表,复制到 hermes config set provider.zhipu.model <正确ID>。GLM-4-Flash 偶尔需要在「开通服务」页手动开通。

  • Timeout after 60s / 上下文超长

    原因 / Cause: 128K 上下文塞太满,模型推理超时;或者网络中转抖动。

    修复 / Fix: 先 hermes context summarize 压缩当前会话;如果是非 RAG 场景大文档,改用流式输出 hermes config set llm.zhipu.stream true。仍超时考虑切到 Kimi-128k,详见 /providers/kimi。

下一步

Kimi 长上下文专用配置

Kimi-1M 处理大型代码库 / 长合同 / 研究文档场景,与 GLM 共存。

看 Kimi 配置

bundled and community Skills 全景图

Hermes Skills 系统:Skills Hub、自学习机制、与 GLM 函数调用配合。

看 Skills 指南

CLI 完整命令参考

hermes config / hermes skills / hermes gateway 等 50+ 命令分类速查。

看 CLI 手册

回到主文档

与 v2026.9.14 同步的完整中文文档,含安装、Skills、Memory、Gateway。

主文档