智谱AI GLM 怎么样?测评与对比
智谱官方API,GLM-4.7-Flash永久免费,200K上下文+SWE-bench 59.2%,国内直连
最后核实日期:2026-07-07 · 访问官网 →
一个让人难以相信的事实
GLM-4.7-Flash,智谱AI旗下最强的免费模型,永久免费,不限用量(实名认证后,约1 req/s速率)。
这个模型有多强?31B总参数/3B激活的MoE架构,200K tokens超长上下文,SWE-bench Verified 59.2%(超越Qwen3-30B-A3B的22.0%约2.7倍),AIME 25数学基准91.6%,GPQA推理75.2%。
免费能做到这个程度,在2026年的大模型市场里依然是异类。本文是智谱AI GLM系列API的完整测评,覆盖从免费到企业级的全系定价、性能基准、接入代码、多模态能力、以及与DeepSeek/Kimi/Qwen的横向对比。
智谱AI是谁
智谱AI(Zhipu AI)成立于2019年,脱胎于清华大学计算机系自然语言处理实验室。在ChatGPT出圈之前,智谱的GLM(General Language Model)系列就已经是国内学术界和工业界使用量最大的预训练语言模型之一。GLM的名字来源于其预训练方式:General Language Model Pretraining with Autoregressive Blank Infilling,与BERT的掩码语言模型和GPT的自回归生成不同,GLM融合了两者的优点,这也是它在中文理解和生成上表现均衡的技术基础。
2023年以后,随着大模型商业化浪潮,智谱开放了GLM API(bigmodel.cn平台),并在2025年将国际品牌统一为 Z.AI(z.ai),提供双接入点:
- 国内:
https://open.bigmodel.cn/api/paas/v4/(直连,无需代理) - 国际:
https://api.z.ai/api/openai/v1(OpenAI兼容)或https://api.z.ai/api/anthropic(Anthropic兼容)
值得注意的是,智谱AI本身不是AI API中转站——它是模型的原始开发者和官方API提供商,类似于国内的月之暗面(Moonshot)。选择智谱GLM直接调用,意味着你在用第一手的模型服务,而非通过中间层。
全系模型与定价
文本模型
| 模型 | 上下文 | 输入($/1M) | 缓存命中($/1M) | 输出($/1M) | 备注 |
|---|---|---|---|---|---|
| GLM-5.2 | 200K | $1.40 | $0.26 | $4.40 | 当前旗舰 |
| GLM-5.1 | 200K | $1.40 | $0.26 | $4.40 | SWE-bench Pro 58.4% |
| GLM-5 | 128K | $1.00 | $0.20 | $3.20 | — |
| GLM-5-Turbo | 128K | $1.20 | $0.24 | $4.00 | — |
| GLM-4.7 | 128K | $0.60 | $0.11 | $2.20 | — |
| GLM-4.7-FlashX | 128K | $0.07 | $0.01 | $0.40 | 极速低价 |
| GLM-4.5-X | — | $2.20 | $0.45 | $8.90 | 扩展推理版 |
| GLM-4.5-Air | 128K | $0.20 | $0.03 | $1.10 | 轻量通用 |
| GLM-4.7-Flash | 200K | 免费 | — | 免费 | 永久免费 |
| GLM-4.5-Flash | 128K | 免费 | — | 免费 | 永久免费 |
视觉与多模态模型
| 模型 | 输入($/1M) | 输出($/1M) | 备注 |
|---|---|---|---|
| GLM-5V-Turbo | $1.20 | $4.00 | 视觉理解旗舰 |
| GLM-4.6V-FlashX | $0.04 | $0.40 | 极速视觉 |
| GLM-4.6V-Flash | 免费 | 免费 | 视觉理解免费版 |
生成类服务
| 服务 | 价格 | 模型 |
|---|---|---|
| 图像生成 | $0.015 / 张 | GLM-Image(CogView系列) |
| 视频生成 | $0.200 / 条 | CogVideoX-3 |
| 语音识别(ASR) | $0.030 / 1M tokens | GLM-ASR-2512 |
| 联网搜索 | $0.010 / 次 | — |
新用户福利:实名认证后获得2000万tokens免费额度,可用于任意付费模型,轻量开发阶段基本够用。
GLM-4.7-Flash:免费模型的基准测试数据
GLM-4.7-Flash采用MoE(混合专家)架构:31B总参数,但每次推理只激活3B参数,这让它在保持强性能的同时大幅降低了推理成本——这也是它能永久免费的技术基础。
基准测试数据(与Qwen3-30B-A3B对比)
| 基准 | GLM-4.7-Flash | Qwen3-30B-A3B | 差距 |
|---|---|---|---|
| SWE-bench Verified(代码) | 59.2% | 22.0% | +169% |
| tau-2 Bench(工具调用) | 79.5 | 49.0 | +62% |
| BrowseComp(网页Agent) | 42.8 | 2.29 | +1769% |
| AIME 25(数学竞赛) | 91.6 | 85.0 | +8% |
| GPQA(科学推理) | 75.2 | 73.4 | +2% |
| LiveCodeBench v6(编程) | 64.0 | 66.0 | -3% |
SWE-bench Verified 59.2% 这个数字是什么概念?这是在真实GitHub Issue上的代码修复任务,59.2% 意味着超过一半的真实Bug可以被这个免费模型自动修复。和GPT-4o(30%出头)、Llama 3.3 70B(~30%)相比,GLM-4.7-Flash的Agent能力远超同级别开源模型。
tau-2 Bench(工具调用基准)79.5 的成绩说明函数调用的可靠性很高,这对需要集成外部API或数据库的Agent场景非常重要。
GLM-5.1旗舰性能
GLM-5.1是目前智谱AI性价比最好的旗舰选项(与GLM-5.2定价相同但已稳定):
- SWE-bench Pro:58.4%(超越GPT-5.4的57.7%和Claude Opus 4.6的57.3%)
- GPQA:83.9(87th percentile,科学推理顶级水准)
- Intelligence指数:35.4(91st percentile)
这意味着在编程Agent和科学推理两个维度,GLM-5.1已经追上甚至超越了OpenAI和Anthropic的同期旗舰模型。
API接入:OpenAI兼容接口
GLM API完全兼容OpenAI SDK,接入成本几乎为零。
基础文字对话
from openai import OpenAI
# 国内用户
client = OpenAI(
api_key="你的GLM API Key",
base_url="https://open.bigmodel.cn/api/paas/v4/"
)
# 海外/国际用户(z.ai端点)
# client = OpenAI(
# api_key="你的GLM API Key",
# base_url="https://api.z.ai/api/openai/v1"
# )
response = client.chat.completions.create(
model="glm-4.7-flash", # 免费模型
messages=[
{"role": "system", "content": "你是一名资深软件工程师,擅长代码审查和重构建议"},
{"role": "user", "content": "请帮我审查以下Python代码的性能问题:\n\n```python\ndef find_duplicates(lst):\n duplicates = []\n for i in range(len(lst)):\n for j in range(i+1, len(lst)):\n if lst[i] == lst[j] and lst[i] not in duplicates:\n duplicates.append(lst[i])\n return duplicates\n```"}
],
max_tokens=2048,
stream=True # 推荐使用流式输出
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end='', flush=True)
从OpenAI无缝切换到GLM
import os
# 只需修改两行,其余代码不变
os.environ["OPENAI_API_KEY"] = "你的GLM API Key"
os.environ["OPENAI_BASE_URL"] = "https://open.bigmodel.cn/api/paas/v4/"
# 原来调用OpenAI的代码无需改动
from openai import OpenAI
client = OpenAI() # 自动读取环境变量
# 将原模型名替换为GLM模型名即可
response = client.chat.completions.create(
model="glm-4.7-flash", # 原来是"gpt-4o"
messages=[{"role": "user", "content": "你好"}]
)
Anthropic兼容端点
Z.AI还提供了Anthropic兼容端点,可以直接替换Claude API地址,用于那些写死了Anthropic SDK的项目:
import anthropic
client = anthropic.Anthropic(
api_key="你的GLM API Key",
base_url="https://api.z.ai/api/anthropic"
)
message = client.messages.create(
model="glm-5.1", # 用GLM模型名
max_tokens=1024,
messages=[
{"role": "user", "content": "分析这段代码的时间复杂度"}
]
)
这对于 claude-code-router 或其他基于Anthropic SDK的工具特别有用:只需改一个 base_url,就能把请求路由到GLM而无需改动任何业务代码。
函数调用(Tool Use):Agent实战
GLM-4.7-Flash的tau-2工具调用基准79.5分说明它在Agent场景的可靠性。实际使用示例:
import json
tools = [
{
"type": "function",
"function": {
"name": "get_stock_price",
"description": "获取指定股票的当前价格",
"parameters": {
"type": "object",
"properties": {
"symbol": {
"type": "string",
"description": "股票代码,如 AAPL、600036"
},
"market": {
"type": "string",
"enum": ["US", "CN"],
"description": "市场:US(美股)或 CN(A股)"
}
},
"required": ["symbol", "market"]
}
}
}
]
response = client.chat.completions.create(
model="glm-4.7-flash",
messages=[
{"role": "user", "content": "帮我查一下招商银行今天的股价"}
],
tools=tools,
tool_choice="auto"
)
# 解析函数调用
if response.choices[0].message.tool_calls:
tool_call = response.choices[0].message.tool_calls[0]
func_name = tool_call.function.name
func_args = json.loads(tool_call.function.arguments)
print(f"调用函数:{func_name}")
print(f"参数:{func_args}")
# 输出: 调用函数:get_stock_price
# 输出: 参数:{'symbol': '600036', 'market': 'CN'}
GLM-4.7-Flash在工具调用的参数提取准确率和Qwen3同级别模型相比有明显优势(79.5 vs 49.0),适合构建需要频繁调用外部工具的Agent流程。
用GLM-4.7-Flash搭建零成本代码审查Bot
GLM-4.7-Flash最直接的落地场景是作为代码审查自动化的底层模型——免费、上下文够长(200K)、编程基准出色。
以下是一个完整的GitHub PR代码审查Bot骨架,每天审查100个PR的成本为零:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://open.bigmodel.cn/api/paas/v4/"
)
CODE_REVIEW_PROMPT = """你是一名资深软件工程师,专注于代码审查。
请分析以下代码变更(Git diff),重点检查:
1. 潜在Bug(边界条件、空指针、并发问题)
2. 性能问题(O(n²)算法、不必要的数据库查询、内存泄漏)
3. 安全漏洞(SQL注入、XSS、敏感信息泄露)
4. 代码可维护性(命名规范、函数长度、耦合度)
请按以下格式输出:
## 严重问题
## 一般建议
## 优点"""
def review_pr(diff_content: str) -> str:
response = client.chat.completions.create(
model="glm-4.7-flash", # 永久免费
messages=[
{"role": "system", "content": CODE_REVIEW_PROMPT},
{"role": "user", "content": f"```diff\n{diff_content}\n```"}
],
max_tokens=3000,
temperature=0.1 # 代码审查场景需要确定性输出
)
return response.choices[0].message.content
# 使用示例
with open("pr.diff") as f:
diff = f.read()
print(review_pr(diff))
成本对比:同样的代码审查Bot,如果用GPT-4o($5/M输入)每天审查100个PR(每个PR平均3K tokens),月成本约$45;用GLM-4.7-Flash为**$0**。
用GLM集成claude-code-router实现智能路由
claude-code-router是一个开源的Claude Code API路由工具,支持把请求分发到不同模型。GLM的Anthropic兼容端点让它可以无缝接入:
{
"ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
"ANTHROPIC_API_KEY": "你的GLM API Key",
"providers": {
"zhipu-flash": {
"baseURL": "https://api.z.ai/api/anthropic",
"apiKey": "你的GLM API Key",
"model": "glm-4.7-flash"
},
"zhipu-flagship": {
"baseURL": "https://api.z.ai/api/anthropic",
"apiKey": "你的GLM API Key",
"model": "glm-5.1"
}
},
"router": {
"default": "zhipu-flash",
"background": "zhipu-flash",
"thinking": "zhipu-flagship"
}
}
这个配置的逻辑:日常任务走GLM-4.7-Flash(免费),复杂推理和需要深度思考的任务切换到GLM-5.1($1.4/M),整体成本比全程用Claude Opus低90%以上。
GLM Coding 专项套餐
智谱AI针对编程场景推出了GLM Coding专项套餐(bigmodel.cn/glm-coding),面向重度使用kimi-k2.7-code或GLM编程模型的用户提供更高的并发上限和更低的单价。
套餐用户的主要权益:
- 更高并发上限:套餐等级越高,可用的模型并发请求数越多
- 低峰期动态提升:在服务器低峰期,套餐用户享受动态并发优先权
- GLM-4.7-Flash优先队列:套餐用户的免费模型请求在排队时有优先级
如果你是重度编程助手用户(日均调用超过200次),Coding套餐的并发权益会比按量付费更划算。
Context缓存:长对话成本控制
GLM-5系列支持Context缓存,原理和Kimi的类似:首次传入的长系统提示词或文档内容被缓存后,后续请求命中缓存的Token以更低价格计费(约为正常价格的18-20%)。
# 假设你有一份2万字的代码库作为上下文
CODEBASE_CONTEXT = "...你的代码库内容..."
# 第一次调用:未缓存,按$1.4/M计费
response1 = client.chat.completions.create(
model="glm-5.1",
messages=[
{"role": "system", "content": f"以下是项目代码库:\n{CODEBASE_CONTEXT}"},
{"role": "user", "content": "找出所有可能的内存泄漏点"}
]
)
# 后续调用:相同前缀内容已缓存,输入按$0.26/M计费(节省81%)
response2 = client.chat.completions.create(
model="glm-5.1",
messages=[
{"role": "system", "content": f"以下是项目代码库:\n{CODEBASE_CONTEXT}"},
{"role": "user", "content": "生成这个代码库的单元测试"}
]
)
# 查看缓存命中情况
usage = response2.usage
print(f"总输入Token:{usage.prompt_tokens}")
if hasattr(usage, 'prompt_tokens_details'):
print(f"缓存命中:{usage.prompt_tokens_details.cached_tokens}")
对于”反复基于同一份代码库或文档问不同问题”的场景,缓存带来的成本节省非常显著——GLM-5.1的缓存命中价格$0.26/M vs正常$1.40/M,节省81%。
多模态全栈
视觉理解(GLM-V系列)
import base64
# 图片理解(本地图片)
with open("chart.png", "rb") as f:
image_data = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="glm-4.6v-flash", # 免费视觉模型
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{image_data}"}
},
{
"type": "text",
"text": "请分析这张图表的数据趋势,提炼三个关键结论"
}
]
}
]
)
图像生成(CogView)
response = client.images.generate(
model="cogview-4",
prompt="一个赛博朋克风格的上海外滩夜景,霓虹灯倒映在黄浦江上,超高清细节",
size="1024x1024",
n=1
)
image_url = response.data[0].url
价格:$0.015/张,折合约¥0.11/张,是目前国内图像生成API中的低价段。
视频生成(CogVideoX-3)
# 文生视频(异步任务)
response = client.videos.generate(
model="cogvideox-3",
prompt="一只橘猫在午后的阳光里打哈欠,毛茸茸的质感,慢动作",
duration=5, # 秒
resolution="720p"
)
task_id = response.id
# 视频生成通常需要30秒到几分钟,通过轮询获取结果
价格:$0.20/条视频,折合约¥1.5/条。
语音识别(ASR)
with open("recording.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="glm-asr-2512",
file=audio_file,
language="zh" # 中文优先
)
print(transcript.text)
价格:$0.03/1M tokens(约$0.0024/分钟),接近 Whisper 的竞争定价。
GLM vs 竞品横向对比
| 智谱AI GLM | DeepSeek V4 Flash | Kimi K2.7-code | Qwen3-30B-A3B | |
|---|---|---|---|---|
| 免费模型 | GLM-4.7-Flash(永久) | 无长期免费档 | 无 | 无长期免费档 |
| 免费模型上下文 | 200K | — | — | — |
| SWE-bench(免费/入门档) | 59.2%(免费!) | — | — | 22.0% |
| 旗舰输入价格 | $1.40/M | $0.14/M | $0.95/M | — |
| 旗舰输出价格 | $4.40/M | $0.55/M | $4.00/M | — |
| 国内直连 | ✓ | ✓ | ✓ | ✓ |
| 视觉理解 | ✓(含免费档) | ✗ | ✗ | ✓ |
| 图像生成 | ✓(¥0.11/张) | ✗ | ✗ | ✓(Wanx) |
| 视频生成 | ✓(¥1.5/条) | ✗ | ✗ | ✗ |
| 语音识别 | ✓ | ✗ | ✗ | ✗ |
| Context缓存 | ✓(GLM-5系列) | ✓ | ✓ | ✓ |
| Anthropic兼容端点 | ✓(z.ai) | ✗ | ✗ | ✗ |
关键结论:
- 免费用量大 + 需要Agent能力:GLM-4.7-Flash几乎是唯一选择,免费+59.2% SWE-bench的组合无可替代
- 极致低价旗舰:DeepSeek V4 Flash以$0.14/M完胜,适合高频日常任务
- 长文档处理:Kimi K2.7的256K上下文+文档专项优化更适合
- 多模态全栈:GLM是唯一一个文本+视觉+图像+视频+语音五件套都能做的国内平台
什么场景适合选智谱AI GLM
强烈推荐的场景:
- 个人开发者/副业项目:GLM-4.7-Flash永久免费,1 req/s对于个人项目绰绰有余,相当于一个性能强劲的免费Claude替代
- 代码审查和重构工具:SWE-bench 59.2%说明GLM-4.7-Flash的编程能力远超同价位,用于代码审查Bot或IDE插件极具性价比
- 需要多模态的SaaS产品:文本+视觉+图像+视频+语音一站完成,减少多供应商管理成本
- 需要Claude/OpenAI API兼容切换的项目:双兼容端点让迁移成本极低
- 高并发的非紧急批处理任务:免费档1 req/s虽然不适合实时应用,但适合夜间批量处理文档、生成报告等场景
不太适合的场景:
- 高并发实时服务(如即时客服):付费档价格竞争力不如DeepSeek,免费档速率不足,两头都不占优
- 纯文本生成的极致低价需求:DeepSeek V4 Flash $0.14/M远低于GLM-5.1的$1.40/M,十倍价差
- 超大规模企业部署:OpenAI/Anthropic的企业SLA、审计功能、合规认证仍然更完善
企业选型:GLM在什么规模下值得认真考虑
初创/个人开发者阶段(月调用 < 100万次)
GLM-4.7-Flash是最佳起点。零成本验证产品想法,等流量上来后再考虑是否升级到付费档。这个阶段的技术建议:
- 用GLM-4.7-Flash处理所有非实时任务(文档处理、代码审查、批量摘要)
- 实时交互场景如果对速率敏感,可以结合SiliconFlow等中转站做GLM的高速版
- 免费额度(2000万tokens)先用完再说
成长期(月调用 100万-1亿次)
这个阶段需要认真比价。关键考量:
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 代码生成/审查 | GLM-4.7-Flash + 付费套餐 | SWE-bench基准最强,并发够 |
| 普通对话 | DeepSeek V4 Flash | $0.14/M远低于GLM-5的$1.4/M |
| 长文档分析 | Kimi K2.7-code 或 GLM-5 | 256K/200K上下文,按文档体量选 |
| 多模态内容生成 | GLM(含图像/视频) | 竞品中唯一全栈 |
| Agent/函数调用 | GLM-4.7-Flash(免费) | tau-2基准79.5领先 |
这个阶段最有价值的策略是”分层路由”:用claude-code-router或类似工具,简单任务走GLM-4.7-Flash(免费),复杂推理走DeepSeek V4 Pro或GLM-5.1(视场景),视觉任务走GLM-V系列。
企业/平台阶段(月调用 > 1亿次)
规模化使用时,GLM的核心优势是国内直连+合规。bigmodel.cn数据中心在国内,满足数据本地化要求;智谱AI有企业合同和定制化SLA。如果你的用户是政府、金融、医疗等数据敏感行业,智谱AI的合规背景(清华系、国内监管认可)是比OpenAI/Anthropic更好的选择。
大规模使用时需要关注:
- 批量折扣谈判(千万级调用量有专属定价)
- 私有化部署选项(智谱AI提供GLM模型的企业私有化方案)
- 与智谱AI签订框架合同,锁定价格避免市场波动影响
实测体验:GLM-4.7-Flash的真实感受
测试了几个实际场景,记录主观体验:
代码审查:给一段有5个不同类型Bug的Python代码,GLM-4.7-Flash识别出4个,漏掉1个时序相关的并发Bug。整体来说对于常见Bug类型(空指针、越界、SQL注入)识别准确率很高,时序和并发Bug是弱点。
长文档理解:输入一篇4万字的技术文档(接近200K token上下文的约1/5),要求提炼20个关键技术决策点。GLM-4.7-Flash的输出结构清晰,对文档中散落的信息整合能力不错,但对技术术语的精确定义有时不如Claude严谨。
函数调用:测试了10个不同结构的工具调用场景(嵌套参数、枚举类型、可选字段等),GLM-4.7-Flash全部正确解析参数结构,没有出现常见的”幻觉参数”或”参数缺失”问题。这和tau-2 79.5的高分是一致的。
响应速度:在国内直连环境下,GLM-4.7-Flash的首Token延迟(TTFT)约300-500ms,输出速度约40-60 tokens/秒。和DeepSeek V4 Flash相比略慢,但对于大多数场景是完全可接受的。高速版(GLM-4.7-FlashX)在速度上有明显提升,但需付费($0.07/M输入)。
中文质量:纯中文写作、中文翻译、中英混合场景的输出质量优于同价位的英文优先模型。这是GLM的历史积累所带来的,清华系中文预训练语料质量高。具体体现在:成语/俗语理解准确、古文转白话流畅、行业术语(法律/医疗/金融)掌握度好于英文优先的模型。对于中文为主的产品,这一点值得重视。
注册与接入说明
国内用户
- 访问 bigmodel.cn,手机号注册
- 实名认证后获得 2000万 tokens 免费额度,并可使用 GLM-4.7-Flash 永久免费额度
- 在控制台创建 API Key
- 接入端点:
https://open.bigmodel.cn/api/paas/v4/
速率限制参考:
- 免费模型(GLM-4.7-Flash):约1 req/s,无并发上限
- 付费套餐:根据套餐等级不同,高峰期有动态并发提升
海外用户 / 需要 Anthropic 兼容端点
- 访问 z.ai 注册(无需中国手机号,邮箱即可)
- 创建 API Key
- OpenAI兼容端点:
https://api.z.ai/api/openai/v1 - Anthropic兼容端点:
https://api.z.ai/api/anthropic(可用于 claude-code-router、Cursor 等工具)
GLM与AI API中转站的关系
很多AI API中转站(如SiliconFlow、AiHubMix、OpenRouter等)也接入了GLM系列模型,通过中转站调用GLM有以下考量:
选择官方直连的理由:
- 模型版本最新(中转站通常有延迟)
- Context缓存可用(部分中转站不转发缓存协议)
- 账号体系清晰,Token用量统计准确
选择中转站的理由:
- 统一账单(多家模型统一付费,无需管理多个API Key)
- 部分中转站提供更低的GLM定价(批量采购折扣)
- 已有中转站基础设施的项目迁移成本低
两种方式没有绝对优劣,取决于你的使用体量和已有架构。如果GLM是你主力依赖的模型,官方直连是更稳的选择;如果只是多模型配置的一个选项,通过中转站统一管理更方便。
与主流开发框架的集成现状
LangChain
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
model="glm-4.7-flash",
api_key="你的GLM API Key",
base_url="https://open.bigmodel.cn/api/paas/v4/",
temperature=0.7
)
# 配合LangChain的LCEL管道
from langchain_core.prompts import ChatPromptTemplate
prompt = ChatPromptTemplate.from_messages([
("system", "你是一名专业的代码助手"),
("user", "{input}")
])
chain = prompt | llm
response = chain.invoke({"input": "用Python实现一个LRU缓存"})
GLM的OpenAI兼容端点使其可以无缝替换LangChain中的ChatOpenAI,无需安装额外依赖。
LlamaIndex
from llama_index.llms.openai import OpenAI as LlamaOpenAI
llm = LlamaOpenAI(
model="glm-4.7-flash",
api_key="你的GLM API Key",
api_base="https://open.bigmodel.cn/api/paas/v4/"
)
# 构建RAG管道
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader
documents = SimpleDirectoryReader("docs/").load_data()
index = VectorStoreIndex.from_documents(documents, llm=llm)
query_engine = index.as_query_engine()
response = query_engine.query("这份文档的核心论点是什么?")
LobeChat / Open WebUI
LobeChat和Open WebUI等开源前端支持自定义OpenAI兼容端点,可以直接填入GLM的接入地址,实现图形化界面调用GLM。配置路径:设置→模型服务商→自定义→填入bigmodel.cn端点和API Key。
Cursor / Continue.dev
这类AI代码编辑器通常支持自定义模型服务商,通过Anthropic兼容端点(https://api.z.ai/api/anthropic)可以把GLM-4.7-Flash接入Cursor的背景补全,实现免费的AI辅助编程。
常见问题(FAQ)
Q:GLM-4.7-Flash真的永久免费,不是试用期? A:是的,GLM-4.7-Flash和GLM-4.5-Flash是智谱AI的永久免费档,没有试用期限制。限制是速率(约1 req/s)而非时间或额度。实名认证是唯一门槛。
Q:免费档的1 req/s限制如何绕过? A:官方不支持绕过速率限制。有几个合法替代方案:① 用多个账号分摊请求(需多个手机号实名);② 购买付费套餐解锁更高并发;③ 把GLM-4.7-Flash用于非实时的批处理任务,速率限制对批处理影响较小。
Q:GLM API是否支持Streaming(流式输出)?
A:支持。在client.chat.completions.create()中加入stream=True即可,与OpenAI的Streaming接口完全兼容。
Q:Context缓存需要手动开启吗? A:不需要。GLM-5系列的Context缓存是自动的——当你发送的请求中前缀与之前的请求相同时,平台会自动识别并以缓存价计费。不需要任何额外参数。
Q:GLM可以处理中文Long-form内容的质量怎么样? A:GLM-4.7-Flash和GLM-5系列在中文上的表现总体优于同类英文优化模型。智谱AI从清华大学NLP实验室起家,中文语料覆盖深,中文指令跟随、中文文档理解、中英混合场景表现稳定。
Q:GLM API Key在国内哪里申请? A:访问 bigmodel.cn → 注册账号 → 手机号实名认证 → 控制台 → API Keys → 新建。整个流程5分钟内完成。GLM-4.7-Flash无需充值即可使用。获取Key后建议立即在控制台设置消费上限,防止意外调用产生超预期账单。
Q:视频生成支持中文提示词吗? A:支持。CogVideoX-3接受中英文prompt,对于中国场景(人物、风景、文化元素)的理解也比部分海外视频生成模型更准确。
Q:GLM是否有企业级SLA? A:有。智谱AI提供企业级合同和SLA,具体条款需联系商务。bigmodel.cn平台标准服务不附带SLA保障,高可用需求建议与智谱AI官方签署企业协议。
总结
智谱AI GLM在2026年的市场里找到了一个很有意思的定位:用GLM-4.7-Flash的免费+高性能拿下开发者,再用GLM-5系列的旗舰能力(尤其是SWE-bench Pro 58.4%超越GPT-5.4)服务企业客户。
对于国内开发者来说,有几个理由让GLM值得认真放进工具箱:
- 国内直连:无需代理,部署最简单
- 永久免费档:GLM-4.7-Flash+GLM-4.6V-Flash让个人项目几乎零成本
- 全模态:文本/视觉/图像/视频/语音一个账号全覆盖
- 双API兼容:OpenAI和Anthropic两套接口,迁移成本极低
- 编程能力出众:免费档SWE-bench 59.2%,远超同价位所有竞品
如果你现在的技术栈里只有OpenAI或Anthropic,花15分钟把GLM-4.7-Flash接进来当免费备用层,是ROI极高的一件小事。
本文信息核实日期:2026-07-07,GLM模型版本和定价持续迭代,请以bigmodel.cn和z.ai官方文档为准。
相关推荐
- 硅基流动 SiliconFlow:国内最大开源模型中转,DeepSeek/Qwen全系低价直连
- 月之暗面 Kimi:256K超长上下文,文档处理场景专项优化
- AiHubMix:Claude/GPT国内直连,Prompt Caching集成,企业首选
- OpenRouter:全球最大模型路由,400+模型统一API,A/B测试友好
快速信息卡
| 定价模式 | GLM-4.7-Flash/4.5-Flash永久免费;GLM-5.2旗舰$1.4/$4.4/M;Context缓存命中后输入折扣最高80% |
|---|---|
| 模型覆盖 | GLM-5系列(旗舰推理)、GLM-4.7系列(编程/通用)、GLM-4.7-Flash(免费MoE)、视觉/图像/视频全栈 |
| 延迟/SLA | 国内直连(bigmodel.cn),海外z.ai,自建推理集群低延迟 |
| 国内直连 | 直连 |
| 适用场景 | 开发者 / 企业 |
| 邀请/返利计划 | 智谱AI暂无公开联盟计划。 |
优点
- GLM-4.7-Flash永久免费:31B参数/3B激活MoE架构,200K超长上下文,SWE-bench Verified 59.2%,零成本即可调用旗舰级编程能力
- 国内直连无需代理:bigmodel.cn官方端点,国内开发者直接访问,无封锁,生产环境稳定可靠
- 多模态全栈覆盖:文本+视觉理解+图像生成(CogView)+视频生成(CogVideoX-3)+语音识别(ASR)一个账号全搞定
缺点
- 免费档速率有限制(约1 req/s),高并发生产场景需购买付费套餐
- GLM-5旗舰定价($1.4/M输入)高于DeepSeek V4 Flash($0.14/M),高频日常任务性价比不如极致性价比竞品
- 国际社区生态弱于OpenAI/Anthropic,第三方插件和开源工具链支持相对少