GB 模型斗兽场 · 公开模型目录

有来源的能力档案。暂无批准公开的实战记录,以下不是本人实测排名。

Claude Fable 5.1

把复杂推理与长程执行放进同一个工作过程。

长任务仍要设置验收点;API 与产品套餐的可用范围分别确认。

官方来源

Claude Opus 5

处理复杂专业工作与工具调用任务。

工具效果依赖执行环境;本档案不承诺账号已获得对应产品入口。

官方来源

Claude Sonnet 5

兼顾日常编码与分析工作。

平衡型是厂商定位,不代表本站已测过速度或费用。

官方来源

Claude Haiku 4.5

处理边界明确的轻量文本与代码任务。

复杂任务需要更细拆分;不能据系列定位推断实际耗时。

官方来源

GPT-6 Astra

处理复杂推理、编码与端到端工作。

API 工具支持与 ChatGPT/Codex 产品入口不同;不推断订阅权益。

官方来源

GPT-5.6 Sol

处理复杂专业任务与多步骤分析。

别名可能随平台更新;历史记录应保存具体版本,不将 Pro 套餐作为模型。

官方来源

GPT-5.6 Terra

平衡常规开发任务的能力与成本。

预算需结合实际输入输出量;不是本站最低价排名。

官方来源

GPT-5.6 Luna

处理对成本敏感、数量较多的明确任务。

大批量执行前仍需抽样验收;未作跨厂商成本比较。

官方来源

DeepSeek V4.1 Flash

接入兼容接口,完成日常开发与工具任务。

旧 v4-flash 请求已路由到新版;历史实战不能因此改写成新版。

官方来源

DeepSeek V4 Pro

保留 V4 Pro 接口对应的模型档案。

官方说明 9 月 14 日后继续服务;未来变更需另查公告。

官方来源

Gemini 3.8 Flash

面向长程软件工程、代理与复杂工作流。

稳定状态不代表本站有实测;工具与配额按具体入口确认。

官方来源

Gemini 3.1 Pro Preview

探索复杂问题分析与代理编码。

预览版本可能调整;正式依赖前核对稳定性与可用区域。

官方来源

Kimi K3

长程编码、知识工作与多模态分析。

权重体量大,本地运行需专门硬件与许可核对;产品与 API 权益分开。

官方来源

Kimi K2.7 Code

面向长上下文中的代码修改与工程任务。

HighSpeed 是另一个接入版本;不能将其吞吐声明套用到本条。

官方来源

Qwen3.8-27B

为本地或自建推理提供编码与视觉能力。

扩展到 1M 需要额外配置与资源;官方托管服务在模型卡中仍标 coming soon。

官方来源

Qwen3.8-Flash-Next

探索长上下文与工具任务的高效推理。

实际吞吐随推理框架与硬件变化,不据名称宣称最快;长上下文扩展需要配置。

官方来源

GLM-5.3

复杂软件工程与长程工具执行的文本模型。

不支持关闭推理;当前或曾订阅 Coding Plan 的账号,API 协议可用范围有限制,接入前查文档。

官方来源

GLM-5

长程代理与复杂系统工程的文本模型。

已不是官方目录中的最新系列;Coding Plan 的 Pro/Max 是套餐,与模型本身分开。

官方来源

MiniMax M3

面向编码、工具执行与多模态长任务。

官方写明 API 最大 1M、保证最低 512K;不能把最大值当成每次请求都可用。

官方来源

MiniMax M2.7

编码、工具工作流与生产力任务的既有系列。

厂商自报 benchmark 不等于本站验证;输入与上下文需补查平台参数页。

官方来源