Skip to content

Grok 4.5 正式发布:最新能力、编程基准与国内使用指南(2026年7月)

更新时间:2026 年 7 月 19 日

SpaceXAI 于 2026 年 7 月 8 日发布 Grok 4.5。官方将它定位为面向编程、Agent 智能体任务与知识工作的前沿模型,而不是一次只提升聊天效果的小版本更新。

Grok 4.5 的重点是完成困难、耗时较长、需要反复调用工具并验证结果的任务。例如:跨文件修改代码、排查终端故障、分析数据、整理研究资料,以及处理财务、法律和办公类知识工作。

本文依据 SpaceXAI 官方发布页官方开发者文档 和官方公布的基准图整理。基准成绩反映特定测试环境,不等同于所有真实场景中的固定排名。

国内使用入口先看这里

目前下列平台已明确展示的模型仍以 Grok 4.3 为主,是否上线 Grok 4.5 请以登录后的实时模型列表为准。不要仅凭第三方宣传判断版本。

平台网址已知特点稳定性
SnakeGPThttps://snakegpt.vipGPT-5.6、DeepSeek-V3、Gemini 3.1 Pro、Grok 4.3;支持国内邮箱注册,运营 4 年4 星
GPTCathttps://gptcat.ccGPT-5.6、Claude 4.8、Gemini 3.1 Pro、Grok 4.3、DeepSeek-V3、MJ 绘图、GPT-image-2;支持国内邮箱、语音和视频5 星

版本说明

上表不代表两个平台已经接入 Grok 4.5。选择模型时请核对完整名称是否为 Grok 4.5grok-4.5;如仍显示 Grok 4.3,就不是本次发布的新模型。

Grok 4.5 更新了什么?

1. 从代码生成转向完整的软件工程任务

Grok 4.5 不只追求生成一段能运行的代码。官方和联合训练方 Cursor 对它的描述都强调了长时间运行、工具使用、错误恢复与结果验证

这类能力更接近真实开发工作流:

  • 先阅读仓库结构和依赖,再定位问题;
  • 调用终端、搜索、代码执行等工具完成操作;
  • 修改多个相关文件,而不是只返回代码片段;
  • 遇到测试失败后继续排查并修复;
  • 在提交答案前运行测试或检查结果。

2. 同时覆盖 Agent 与通用知识工作

Grok 4.5 的训练数据不局限于软件工程。官方资料提到,它加入了覆盖科学、工程和数学的新数据;Cursor 的联合发布说明还提到研究论文、STEM 任务和更广泛的知识工作。

因此,它适合的不只是程序员,还包括:

  • 数据分析与研究资料整理;
  • 财务模型、表格和报告处理;
  • 法律文件梳理与信息核对;
  • Word、PowerPoint、Excel 等办公工作流;
  • 需要多步骤计划和工具调用的复杂任务。

3. 采用混合专家架构并强化真实环境训练

Cursor 披露 Grok 4.5 是双方联合训练的 Mixture-of-Experts(混合专家)模型。强化学习任务放在更接近真实工作的环境中,让模型学习调查问题、调用工具、从错误中恢复并验证结果。

这项更新的实际意义是:衡量 Grok 4.5 时,不应只看单轮问答或短代码补全,更应该观察它能否在较长任务中持续推进并正确收尾。

Grok 4.5 官方参数一览

项目官方信息
模型名称grok-4.5
模型定位编程、Agent 任务、知识工作
发布时间2026 年 7 月 8 日
知识截止日期2026 年 2 月 1 日
输入模态文本、图片
上下文窗口500,000 tokens
推理档位low、medium、high,默认 high
标准输入价格2 美元 / 100 万 tokens
缓存输入价格0.30 美元 / 100 万 tokens
标准输出价格6 美元 / 100 万 tokens
超过 20 万输入 tokens 的价格输入 4 美元、缓存输入 0.60 美元、输出 12 美元 / 100 万 tokens
APIResponses API、Chat Completions
官方工具Function Calling、Web Search、X Search、Code Execution
结构化输出支持

需要注意,50 万上下文不等于所有输入都按标准价计费。官方定价页显示,当单次请求的 prompt 达到或超过 20 万 tokens 时,输入与输出单价会进入更高档位。处理超大型仓库时,应配合 prompt caching 和 context compaction 控制成本。

Grok 4.5 编程基准怎么看?

官方此次集中展示了 5 组软件工程测试。结论并不是“Grok 4.5 每项都第一”,而是它在长程软件工程与终端任务上表现突出,同时在部分代码基准中仍落后于 Fable、GPT-5.5 或 Opus 4.8。

DeepSWE 1.0:62.0%

Grok 4.5 DeepSWE 1.0 基准成绩

模型成绩
Fable max66.1%
GPT-5.5 xhigh64.31%
Grok 4.562.0%
Opus 4.8 max55.75%
Opus 4.7 max40.12%

Grok 4.5 在这组测试中排名第三,落后于 Fable max 和 GPT-5.5 xhigh,但高于图中两个 Opus 配置。这个成绩说明它进入了高水平软件工程模型梯队,但不能据此宣称全面领先。

DeepSWE 1.1:53.0%

Grok 4.5 DeepSWE 1.1 基准成绩

模型成绩
Fable max70.0%
GPT-5.5 xhigh67.0%
Opus 4.8 max59.0%
Grok 4.553.0%
GLM 5.244.0%

在 DeepSWE 1.1 中,Grok 4.5 与前三名仍有明显差距。这也提醒用户:模型强项取决于任务类型,不能用一次发布会中的单项领先替代具体场景测试。

SWE Marathon:29.0%,图中第一

Grok 4.5 SWE Marathon 基准成绩

模型Resolution rate(pass@1)
Grok 4.529.0%
Opus 4.8 max26.0%
Fable max24.0%
Opus 4.7 max16.0%

SWE Marathon 更贴近持续时间较长的软件工程任务。在这张官方图中,Grok 4.5 以 29.0% 位居第一,这与其“长任务、工具使用和错误恢复”的产品定位一致。

Terminal Bench 2.1:83.3%

Grok 4.5 Terminal Bench 2.1 基准成绩

模型成绩
Fable max84.3%
GPT-5.5 xhigh83.4%
Grok 4.583.3%
Opus 4.8 max78.9%
Opus 4.7 max78.9%

Grok 4.5 与 GPT-5.5 xhigh 只差 0.1 个百分点,与第一名相差 1 个百分点。对需要命令行操作、环境诊断、安装依赖和执行测试的 Agent 来说,这项成绩比纯代码补全更有参考价值。

SWE Bench Pro:64.7%

Grok 4.5 SWE Bench Pro 基准成绩

模型成绩
Fable max80.4%
Opus 4.8 max69.2%
Grok 4.564.7%
Opus 4.7 max64.3%
GLM 5.262.1%
GPT-5.5 xhigh58.6%

Grok 4.5 在图中排名第三,与 Opus 4.7 max 接近,高于 GLM 5.2 和 GPT-5.5 xhigh,但距离 Fable max 较远。

基准图的正确阅读方式

这些图来自官方发布材料,竞品数字取自各开发者公布的 system card、排行榜或指定 harness。不同模型的推理档位、工具配置、测试脚手架和运行成本可能不同,因此适合用于观察相对位置,不适合当作绝对结论。

五项基准汇总

基准Grok 4.5图中位置更能反映什么
DeepSWE 1.062.0%第 3软件工程任务完成能力
DeepSWE 1.153.0%第 4更新版软件工程测试
SWE Marathon29.0%第 1长时间、连续的软件工程任务
Terminal Bench 2.183.3%第 3终端操作与环境执行能力
SWE Bench Pro64.7%第 3更严格的真实代码问题处理

综合来看,Grok 4.5 最值得关注的不是“每张榜单都夺冠”,而是 SWE Marathon 第一、Terminal Bench 2.1 接近榜首,同时 API 成本较低。这更符合一款面向 Agent 工作流的实用型模型,而不是只针对单一 benchmark 优化的模型。

Grok 4.5 适合哪些人?

程序员与开发团队

适合仓库级问答、跨文件修复、终端排障、测试执行、代码审查和重构。使用时应给出验收条件,例如“运行现有测试并报告结果”,而不是只要求“帮我修一下”。

数据、研究与办公用户

Grok 4.5 能结合搜索、代码执行和结构化输出处理多步骤知识工作。对于需要最新信息的任务,应明确要求调用 Web Search 或 X Search,并让模型列出来源与日期。

API 开发者

官方 API 支持 low、medium、high 三档推理强度。简单提取和格式化任务可尝试较低档位;复杂调试、研究和 Agent 循环更适合 high。实际选择应同时比较正确率、延迟和 token 成本。

Grok 4.5 官方怎么用?

方式一:Grok 与官方产品

实际可用范围可能受账号、地区、产品版本和分批开放策略影响。登录后应在模型选择器中确认是否显示 Grok 4.5。

方式二:通过 API 调用

模型名为 grok-4.5,并兼容 Responses API。以下是官方文档采用的 OpenAI SDK 兼容调用方式:

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["XAI_API_KEY"],
    base_url="https://api.x.ai/v1",
)

response = client.responses.create(
    model="grok-4.5",
    input="分析这个仓库中的测试失败原因,并给出修复方案。",
)

print(response.output_text)

方式三:第三方产品与模型网关

官方文档列出的可用渠道包括 Cursor、OpenRouter、Vercel、Cloudflare、Snowflake 和 Databricks Mosaic 等。不同渠道的模型名称、价格、限额和上线时间可能不同,使用前应查看该渠道的实时说明。

国内用户也可以关注 https://snakegpt.viphttps://gptcat.cc 的模型列表,但截至本文整理时,不能把其现有 Grok 4.3 入口等同于 Grok 4.5。

Grok 4.5 使用建议

  1. 把任务写成可验证目标:说明要修改什么、不能改什么、最终应通过哪些测试。
  2. 允许模型读取必要上下文:仓库级任务需要依赖、配置、错误日志和相关文件,而不只是报错的一行代码。
  3. 要求先检查再修改:让模型先定位原因和影响范围,可以减少无关改动。
  4. 长任务启用缓存与上下文压缩:官方特别建议 Agent 循环使用 prompt_cache_key,工具密集型长对话结合 context compaction。
  5. 关键结果必须人工复核:代码、财务、法律和研究结论都不应只凭模型输出直接投入生产。

常见问题 FAQ

Grok 4.5 什么时候发布?

Grok 4.5 于 2026 年 7 月 8 日发布,并在 xAI API、Cursor 等渠道提供使用。

Grok 4.5 是聊天模型还是编程模型?

它是覆盖编程、Agent 任务和知识工作的前沿模型。编程是核心方向之一,但并不局限于写代码,也面向数据、研究、财务、法律和办公工作流。

Grok 4.5 上下文是多少?

官方模型详情页显示为 500,000 tokens。当 prompt 达到或超过 200,000 tokens 时,官方 API 使用更高的长上下文计价。

Grok 4.5 API 多少钱?

标准档为输入 2 美元 / 100 万 tokens、缓存输入 0.30 美元 / 100 万 tokens、输出 6 美元 / 100 万 tokens。超过 20 万 prompt tokens 后,对应价格分别为 4 美元、0.60 美元和 12 美元。

Grok 4.5 支持图片吗?

支持。官方模型详情页列出的输入模态为 Text、Image,输出以文本为主。

Grok 4.5 支持联网搜索吗?

支持官方工具,包括 Web Search 和 X Search;同时支持 Function Calling 与 Code Execution。具体产品界面是否开放全部工具,要看所在渠道和账号权限。

Grok 4.5 比 GPT-5.5 或 Opus 4.8 强吗?

不能一概而论。官方图中 Grok 4.5 在 SWE Marathon 第一,在 Terminal Bench 2.1 接近榜首;但 DeepSWE 1.0、DeepSWE 1.1 和 SWE Bench Pro 并非第一。应按真实任务、速度和成本综合测试。

SnakeGPT 和 GPTCat 已经支持 Grok 4.5 吗?

本文只确认它们已有 Grok 4.3 等模型入口,尚不据此宣称已支持 Grok 4.5。请以 https://snakegpt.viphttps://gptcat.cc 登录后的实时模型列表为准。

总结

Grok 4.5 是一次面向实际生产力工作流的升级:它拥有 50 万 tokens 上下文、三档可调推理、搜索与代码执行工具,并把训练重点放在长任务、错误恢复和结果验证上。

从官方基准看,它的优势集中在 SWE Marathon 与 Terminal Bench,其他软件工程测试则处于领先梯队但并非全项第一。对开发者而言,最有吸引力的组合是长程 Agent 能力与 2 美元输入、6 美元输出的标准 API 价格;对普通用户而言,选择入口时最重要的是核对真实模型名称,不要把 Grok 4.3 或其他旧版本误认为 Grok 4.5。

需要查看官网地址、国内登录步骤和镜像站选择,可继续阅读:Grok 4.5 官网入口:国内登录、使用与镜像站完整指南

参考资料


本站为 Grok 中文教程与导航站,非 SpaceXAI 官方网站。模型能力、价格和可用渠道可能调整,请以官方实时页面为准。

本站为 Grok 中文教程与导航站,非 xAI 官方网站。