深色模式
Grok 4.5 正式发布:最新能力、编程基准与国内使用指南(2026年7月)
更新时间:2026 年 7 月 19 日
SpaceXAI 于 2026 年 7 月 8 日发布 Grok 4.5。官方将它定位为面向编程、Agent 智能体任务与知识工作的前沿模型,而不是一次只提升聊天效果的小版本更新。
Grok 4.5 的重点是完成困难、耗时较长、需要反复调用工具并验证结果的任务。例如:跨文件修改代码、排查终端故障、分析数据、整理研究资料,以及处理财务、法律和办公类知识工作。
本文依据 SpaceXAI 官方发布页、官方开发者文档 和官方公布的基准图整理。基准成绩反映特定测试环境,不等同于所有真实场景中的固定排名。
国内使用入口先看这里
目前下列平台已明确展示的模型仍以 Grok 4.3 为主,是否上线 Grok 4.5 请以登录后的实时模型列表为准。不要仅凭第三方宣传判断版本。
| 平台 | 网址 | 已知特点 | 稳定性 |
|---|---|---|---|
| SnakeGPT | https://snakegpt.vip | GPT-5.6、DeepSeek-V3、Gemini 3.1 Pro、Grok 4.3;支持国内邮箱注册,运营 4 年 | 4 星 |
| GPTCat | https://gptcat.cc | GPT-5.6、Claude 4.8、Gemini 3.1 Pro、Grok 4.3、DeepSeek-V3、MJ 绘图、GPT-image-2;支持国内邮箱、语音和视频 | 5 星 |
版本说明
上表不代表两个平台已经接入 Grok 4.5。选择模型时请核对完整名称是否为 Grok 4.5 或 grok-4.5;如仍显示 Grok 4.3,就不是本次发布的新模型。
Grok 4.5 更新了什么?
1. 从代码生成转向完整的软件工程任务
Grok 4.5 不只追求生成一段能运行的代码。官方和联合训练方 Cursor 对它的描述都强调了长时间运行、工具使用、错误恢复与结果验证。
这类能力更接近真实开发工作流:
- 先阅读仓库结构和依赖,再定位问题;
- 调用终端、搜索、代码执行等工具完成操作;
- 修改多个相关文件,而不是只返回代码片段;
- 遇到测试失败后继续排查并修复;
- 在提交答案前运行测试或检查结果。
2. 同时覆盖 Agent 与通用知识工作
Grok 4.5 的训练数据不局限于软件工程。官方资料提到,它加入了覆盖科学、工程和数学的新数据;Cursor 的联合发布说明还提到研究论文、STEM 任务和更广泛的知识工作。
因此,它适合的不只是程序员,还包括:
- 数据分析与研究资料整理;
- 财务模型、表格和报告处理;
- 法律文件梳理与信息核对;
- Word、PowerPoint、Excel 等办公工作流;
- 需要多步骤计划和工具调用的复杂任务。
3. 采用混合专家架构并强化真实环境训练
Cursor 披露 Grok 4.5 是双方联合训练的 Mixture-of-Experts(混合专家)模型。强化学习任务放在更接近真实工作的环境中,让模型学习调查问题、调用工具、从错误中恢复并验证结果。
这项更新的实际意义是:衡量 Grok 4.5 时,不应只看单轮问答或短代码补全,更应该观察它能否在较长任务中持续推进并正确收尾。
Grok 4.5 官方参数一览
| 项目 | 官方信息 |
|---|---|
| 模型名称 | grok-4.5 |
| 模型定位 | 编程、Agent 任务、知识工作 |
| 发布时间 | 2026 年 7 月 8 日 |
| 知识截止日期 | 2026 年 2 月 1 日 |
| 输入模态 | 文本、图片 |
| 上下文窗口 | 500,000 tokens |
| 推理档位 | low、medium、high,默认 high |
| 标准输入价格 | 2 美元 / 100 万 tokens |
| 缓存输入价格 | 0.30 美元 / 100 万 tokens |
| 标准输出价格 | 6 美元 / 100 万 tokens |
| 超过 20 万输入 tokens 的价格 | 输入 4 美元、缓存输入 0.60 美元、输出 12 美元 / 100 万 tokens |
| API | Responses API、Chat Completions |
| 官方工具 | Function Calling、Web Search、X Search、Code Execution |
| 结构化输出 | 支持 |
需要注意,50 万上下文不等于所有输入都按标准价计费。官方定价页显示,当单次请求的 prompt 达到或超过 20 万 tokens 时,输入与输出单价会进入更高档位。处理超大型仓库时,应配合 prompt caching 和 context compaction 控制成本。
Grok 4.5 编程基准怎么看?
官方此次集中展示了 5 组软件工程测试。结论并不是“Grok 4.5 每项都第一”,而是它在长程软件工程与终端任务上表现突出,同时在部分代码基准中仍落后于 Fable、GPT-5.5 或 Opus 4.8。
DeepSWE 1.0:62.0%

| 模型 | 成绩 |
|---|---|
| Fable max | 66.1% |
| GPT-5.5 xhigh | 64.31% |
| Grok 4.5 | 62.0% |
| Opus 4.8 max | 55.75% |
| Opus 4.7 max | 40.12% |
Grok 4.5 在这组测试中排名第三,落后于 Fable max 和 GPT-5.5 xhigh,但高于图中两个 Opus 配置。这个成绩说明它进入了高水平软件工程模型梯队,但不能据此宣称全面领先。
DeepSWE 1.1:53.0%

| 模型 | 成绩 |
|---|---|
| Fable max | 70.0% |
| GPT-5.5 xhigh | 67.0% |
| Opus 4.8 max | 59.0% |
| Grok 4.5 | 53.0% |
| GLM 5.2 | 44.0% |
在 DeepSWE 1.1 中,Grok 4.5 与前三名仍有明显差距。这也提醒用户:模型强项取决于任务类型,不能用一次发布会中的单项领先替代具体场景测试。
SWE Marathon:29.0%,图中第一

| 模型 | Resolution rate(pass@1) |
|---|---|
| Grok 4.5 | 29.0% |
| Opus 4.8 max | 26.0% |
| Fable max | 24.0% |
| Opus 4.7 max | 16.0% |
SWE Marathon 更贴近持续时间较长的软件工程任务。在这张官方图中,Grok 4.5 以 29.0% 位居第一,这与其“长任务、工具使用和错误恢复”的产品定位一致。
Terminal Bench 2.1:83.3%

| 模型 | 成绩 |
|---|---|
| Fable max | 84.3% |
| GPT-5.5 xhigh | 83.4% |
| Grok 4.5 | 83.3% |
| Opus 4.8 max | 78.9% |
| Opus 4.7 max | 78.9% |
Grok 4.5 与 GPT-5.5 xhigh 只差 0.1 个百分点,与第一名相差 1 个百分点。对需要命令行操作、环境诊断、安装依赖和执行测试的 Agent 来说,这项成绩比纯代码补全更有参考价值。
SWE Bench Pro:64.7%

| 模型 | 成绩 |
|---|---|
| Fable max | 80.4% |
| Opus 4.8 max | 69.2% |
| Grok 4.5 | 64.7% |
| Opus 4.7 max | 64.3% |
| GLM 5.2 | 62.1% |
| GPT-5.5 xhigh | 58.6% |
Grok 4.5 在图中排名第三,与 Opus 4.7 max 接近,高于 GLM 5.2 和 GPT-5.5 xhigh,但距离 Fable max 较远。
基准图的正确阅读方式
这些图来自官方发布材料,竞品数字取自各开发者公布的 system card、排行榜或指定 harness。不同模型的推理档位、工具配置、测试脚手架和运行成本可能不同,因此适合用于观察相对位置,不适合当作绝对结论。
五项基准汇总
| 基准 | Grok 4.5 | 图中位置 | 更能反映什么 |
|---|---|---|---|
| DeepSWE 1.0 | 62.0% | 第 3 | 软件工程任务完成能力 |
| DeepSWE 1.1 | 53.0% | 第 4 | 更新版软件工程测试 |
| SWE Marathon | 29.0% | 第 1 | 长时间、连续的软件工程任务 |
| Terminal Bench 2.1 | 83.3% | 第 3 | 终端操作与环境执行能力 |
| SWE Bench Pro | 64.7% | 第 3 | 更严格的真实代码问题处理 |
综合来看,Grok 4.5 最值得关注的不是“每张榜单都夺冠”,而是 SWE Marathon 第一、Terminal Bench 2.1 接近榜首,同时 API 成本较低。这更符合一款面向 Agent 工作流的实用型模型,而不是只针对单一 benchmark 优化的模型。
Grok 4.5 适合哪些人?
程序员与开发团队
适合仓库级问答、跨文件修复、终端排障、测试执行、代码审查和重构。使用时应给出验收条件,例如“运行现有测试并报告结果”,而不是只要求“帮我修一下”。
数据、研究与办公用户
Grok 4.5 能结合搜索、代码执行和结构化输出处理多步骤知识工作。对于需要最新信息的任务,应明确要求调用 Web Search 或 X Search,并让模型列出来源与日期。
API 开发者
官方 API 支持 low、medium、high 三档推理强度。简单提取和格式化任务可尝试较低档位;复杂调试、研究和 Agent 循环更适合 high。实际选择应同时比较正确率、延迟和 token 成本。
Grok 4.5 官方怎么用?
方式一:Grok 与官方产品
- Grok 官网:https://grok.com
- SpaceXAI API 控制台:https://console.x.ai
- 官方开发者文档:https://docs.x.ai/developers/grok-4-5
实际可用范围可能受账号、地区、产品版本和分批开放策略影响。登录后应在模型选择器中确认是否显示 Grok 4.5。
方式二:通过 API 调用
模型名为 grok-4.5,并兼容 Responses API。以下是官方文档采用的 OpenAI SDK 兼容调用方式:
python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["XAI_API_KEY"],
base_url="https://api.x.ai/v1",
)
response = client.responses.create(
model="grok-4.5",
input="分析这个仓库中的测试失败原因,并给出修复方案。",
)
print(response.output_text)方式三:第三方产品与模型网关
官方文档列出的可用渠道包括 Cursor、OpenRouter、Vercel、Cloudflare、Snowflake 和 Databricks Mosaic 等。不同渠道的模型名称、价格、限额和上线时间可能不同,使用前应查看该渠道的实时说明。
国内用户也可以关注 https://snakegpt.vip 和 https://gptcat.cc 的模型列表,但截至本文整理时,不能把其现有 Grok 4.3 入口等同于 Grok 4.5。
Grok 4.5 使用建议
- 把任务写成可验证目标:说明要修改什么、不能改什么、最终应通过哪些测试。
- 允许模型读取必要上下文:仓库级任务需要依赖、配置、错误日志和相关文件,而不只是报错的一行代码。
- 要求先检查再修改:让模型先定位原因和影响范围,可以减少无关改动。
- 长任务启用缓存与上下文压缩:官方特别建议 Agent 循环使用
prompt_cache_key,工具密集型长对话结合 context compaction。 - 关键结果必须人工复核:代码、财务、法律和研究结论都不应只凭模型输出直接投入生产。
常见问题 FAQ
Grok 4.5 什么时候发布?
Grok 4.5 于 2026 年 7 月 8 日发布,并在 xAI API、Cursor 等渠道提供使用。
Grok 4.5 是聊天模型还是编程模型?
它是覆盖编程、Agent 任务和知识工作的前沿模型。编程是核心方向之一,但并不局限于写代码,也面向数据、研究、财务、法律和办公工作流。
Grok 4.5 上下文是多少?
官方模型详情页显示为 500,000 tokens。当 prompt 达到或超过 200,000 tokens 时,官方 API 使用更高的长上下文计价。
Grok 4.5 API 多少钱?
标准档为输入 2 美元 / 100 万 tokens、缓存输入 0.30 美元 / 100 万 tokens、输出 6 美元 / 100 万 tokens。超过 20 万 prompt tokens 后,对应价格分别为 4 美元、0.60 美元和 12 美元。
Grok 4.5 支持图片吗?
支持。官方模型详情页列出的输入模态为 Text、Image,输出以文本为主。
Grok 4.5 支持联网搜索吗?
支持官方工具,包括 Web Search 和 X Search;同时支持 Function Calling 与 Code Execution。具体产品界面是否开放全部工具,要看所在渠道和账号权限。
Grok 4.5 比 GPT-5.5 或 Opus 4.8 强吗?
不能一概而论。官方图中 Grok 4.5 在 SWE Marathon 第一,在 Terminal Bench 2.1 接近榜首;但 DeepSWE 1.0、DeepSWE 1.1 和 SWE Bench Pro 并非第一。应按真实任务、速度和成本综合测试。
SnakeGPT 和 GPTCat 已经支持 Grok 4.5 吗?
本文只确认它们已有 Grok 4.3 等模型入口,尚不据此宣称已支持 Grok 4.5。请以 https://snakegpt.vip 和 https://gptcat.cc 登录后的实时模型列表为准。
总结
Grok 4.5 是一次面向实际生产力工作流的升级:它拥有 50 万 tokens 上下文、三档可调推理、搜索与代码执行工具,并把训练重点放在长任务、错误恢复和结果验证上。
从官方基准看,它的优势集中在 SWE Marathon 与 Terminal Bench,其他软件工程测试则处于领先梯队但并非全项第一。对开发者而言,最有吸引力的组合是长程 Agent 能力与 2 美元输入、6 美元输出的标准 API 价格;对普通用户而言,选择入口时最重要的是核对真实模型名称,不要把 Grok 4.3 或其他旧版本误认为 Grok 4.5。
需要查看官网地址、国内登录步骤和镜像站选择,可继续阅读:Grok 4.5 官网入口:国内登录、使用与镜像站完整指南。
参考资料
- SpaceXAI:Introducing Grok 4.5
- SpaceXAI Docs:Grok 4.5
- SpaceXAI Docs:Grok 4.5 模型详情
- SpaceXAI Docs:API Pricing
- Cursor:Introducing Grok 4.5
本站为 Grok 中文教程与导航站,非 SpaceXAI 官方网站。模型能力、价格和可用渠道可能调整,请以官方实时页面为准。