免费大模型实跑 4 万次,最低成功率 0.3%
前几天那几篇实测都是现场调几次,只能证明「此刻能调通」。这次我把网关一个月的生产日志拉出来:44144 次调用、4970 万 token、7415 次失败。成功率最高的 Cerebras 98.7%、GLM-4-Flash 98.2%,最低的 Kimi 只有 0.3%(1554 次成功 4 次)。还发现两件事:我上一篇报的延迟是错的,以及网关账单在两个方向上都不准,其中一个方向把账户跑到了欠费停服。
前几天我写过两篇免费大模型的实测,都是现场调几次、记下能不能通、快不快。那种测法有个天然的问题:它只能证明「此刻能调通」,证明不了「长期能用」。
这次换个法子。
我服务器上挂着一个模型网关,所有项目的大模型调用都从它走,它把每一次调用都写进数据库:走了哪个模型、成功还是失败、耗时多少、烧了多少 token。
我把最近一个月的日志拉了出来。
44144 次调用,4970 万 token,时间跨度 2026 年 7 月 12 日到 8 月 12 日,整一个月。
这不是实验室数据,是真实业务跑出来的。结果跟我自己前几天写的那些,差得有点远。

成功率排名,最低的那个只有 0.3%
先看最要紧的一张表。这里的成功率,是「调用返回了可用结果」占该模型全部调用的比例:
| 模型 | 调用次数 | 成功率 |
|---|---|---|
| Cerebras oss-120b | 2814 | 98.7% |
| 智谱 GLM-4-Flash | 25328 | 98.2% |
| Groq oss-120b | 1838 | 87.4% |
| Mistral Large | 683 | 84.0% |
| 智谱 GLM-4.7-Flash | 1530 | 80.3% |
| 火山 GLM-5.2 | 4657 | 64.9% |
| GitHub GPT-4.1 | 3254 | 42.0% |
| ModelScope DeepSeek-V4 | 1846 | 37.9% |
| Kimi k2.6 | 1554 | 0.3% |
Kimi 那一行我看了三遍。1554 次调用,成功 4 次。
失败的 1550 次里,日志记的是同一类错误,平均耗时 15 毫秒。15 毫秒意味着请求根本没到模型那儿就被打回来了,属于鉴权或者额度层面的秒拒。网关记录里的错误堆栈被截断了,我没能确认它到底卡在哪一环,所以这里只说现象:它在我这个账号上,一个月里基本处于不可用状态。
这件事最值得说的地方在于:如果你只是现场调一次,你很可能测不出来。你运气好赶上那 4 次成功中的一次,就会把它写进「可用」名单。
排在前面的两个倒是稳得出奇。Cerebras 98.7%,GLM-4-Flash 在两万五千次调用的基数上还有 98.2%。基数越大越说明问题,一个模型被调两万五千次还能保持 98%,跟被调五十次成功四十九次,完全不是一个可信度。
中间那几个也值得看一眼。火山 64.9%,等于三次里有一次要重来。GitHub GPT-4.1 只有 42%,这个数字有它的背景:GitHub Models 在 7 月 30 日已经彻底退役,这一个月里它有相当一段时间是在退役过程中的。ModelScope 的 DeepSeek-V4 是 37.9%,跟它后来模型下架对得上。
我上一篇报的延迟,是错的
这条得单独认一下。
8 月 10 日那篇里我写 GLM-4-Flash「1.5 秒返回」,那是我现场调一个短问题测出来的。而生产日志里,同一个模型的平均耗时是 21 秒。
差了十四倍。我一开始以为是模型降速了,把耗时按区间拆开一看,不是:
| 耗时区间 | 次数 | 平均输出 token |
|---|---|---|
| 3 秒以内 | 721 | 360 |
| 3 到 10 秒 | 3385 | 417 |
| 10 到 60 秒 | 20696 | 1505 |
| 超过 60 秒 | 69 | 3298 |
八成以上的调用落在 10 到 60 秒那一档,而那一档的平均输出是 1505 个 token。3 秒内返回的那 721 次,平均输出只有 360 token。
模型没变慢,是任务变长了。
这就引出一条我以后会一直记着的判断:脱离输出长度谈延迟,等于没说。任何一篇测评告诉你某个模型「零点几秒返回」,你都得先问一句:它当时输出了多少字?拿一个二十字的问答测出来的速度,跟你实际让它写一千五百 token 的长文,中间隔着一个数量级。
我自己就是那个报了错误数字的人,所以这条写得格外用力。

兜底的那个,成了干活最多的
还有一个数字我盯了很久。
GLM-4-Flash 被调了 25328 次,占全部调用的 57.4%;它消耗的 token 占到总量的 66.5%。
而按设计,它是整条链上的最后一道防线。前面依次排着火山、GitHub、Cerebras、ModelScope 这些更强的模型,只有它们全都失败了,才轮得到它。
结果它干了一多半的活。
这件事反过来说明前面那几环的失败率有多高。整体 44144 次调用里失败了 7415 次,成功率 83.2%,也就是平均每六次调用就有一次得往下一环走。走着走着,大量流量就沉到最底下那个最弱的模型身上了。
这里有个容易被忽略的隐患:你以为系统的能力由链头那个最强的模型决定,实际上它由兜底那个最弱的决定。因为真正处理了大部分请求的是后者。
如果你也在用类似的降级链,值得去查一下各环的实际命中比例。设计图上的主力和日志里的主力,很可能不是同一个。
账单在两个方向上都不准
这是这次翻日志最意外的发现。
网关记录的一个月总花费是 5.64 美元。看上去很合理:四万多次调用、五千万 token,花掉五块多美元,几乎等于免费。
但这个数字两头都不对。
先说被高估的那头。5.64 美元里有 5.58 是记在 GPT-4.1 上的。可我查了这些调用的实际出口地址,走的是 models.github.ai,也就是 GitHub Models 的免费渠道。网关不知道这条渠道免费,就按 OpenAI 官方的价目表估了一个成本出来。
这笔钱压根没花出去。换句话说,账单上 99% 的金额是估算出来的假账。
再说被漏记的那头,这个要命得多。
日志里有一个叫 glm-5-2-260617 的模型,被调了 150 次,烧掉 48 万 token,网关记录的花费是 0.000000。
而这个模型 ID,恰恰是要收费的那条通道。
我在 8 月 11 日那篇文章里专门写过这个坑:火山的 GLM-5.2 必须用授权接入点的 EP ID 调才免费,直接用 Model ID 调是按 Token 后付费,而且调用完全正常、不报任何错。
写完那篇的第二天,我在自己的日志里查到了 150 次这样的调用。
然后今天,这个账户报了欠费。再调任何火山的模型,包括本来免费的那个接入点,返回的都是账户欠费错误。
整条链是这样的:配置里混进了付费通道,调用一切正常没有任何报错,网关账单显示花费为零,直到账户余额被扣穿,连同免费额度一起被锁死。
所以「网关显示花了 0 元」这件事,一点也不能让人安心。它可能是真的没花钱,也可能是它根本不知道这条通道要花钱。

那到底该怎么挑
把这一个月的数据摊开之后,我自己的排法变了。
要稳,选 Cerebras 和 GLM-4-Flash。98.7% 和 98.2%,而且后者是在两万五千次的基数上做到的。任何链路的最后一道兜底,我都会挂 GLM-4-Flash,它弱,但它几乎不掉链子。
别只看一次调用的结果。Kimi 在我这里是 0.3%,可它在别人的账号上完全可能是好的,因为失败大概率跟额度和账户状态有关,而不是模型本身。反过来说也成立:你现场测通了,不代表它明天还通。要判断一个免费模型能不能进生产,得看它在你自己账号上连续跑一段时间的记录。
做好失败是常态的准备。这一个月 44144 次调用里,失败了 7415 次,整体成功率 83.2%,平均每六次调用就有一次要重来。如果没有一条自动降级的链路,这七千多次就是七千多个报错弹到用户脸上。免费模型最大的成本不是钱,是你必须为它们的不稳定写一整套重试和降级逻辑。
盯住那些不报错的通道。报错的模型不可怕,它当场就告诉你了。可怕的是像火山那条付费通道一样,调用正常、账单为零、直到账户被扣停。定期去供应商后台核对一次真实账单,别只信自己网关里的数字。
这份数据的边界
得说清楚它能证明什么、不能证明什么。
这是一个账号、一个月、四万多次的记录,来自我自己的服务器。里面每个模型的调用量差别很大,GLM-4-Flash 有两万五千次,Mistral 只有六百多次,样本量小的那几个成功率误差会更大。
失败的原因我没有逐条归因。有些是模型侧的问题,有些是我这边额度耗尽或者配置错误,日志里区分不出来。所以上面这张表更适合当作「在类似的使用强度下,这些模型的稳定性大致处于什么水平」,而不是各家服务质量的权威评分。
但有一点我可以确定:这种数据只能靠自己跑出来。没有哪份公开的免费模型清单会告诉你某个模型在真实业务里的成功率是 0.3%,因为写清单的人只调了一次,而那一次通了。
如果你也在生产里用免费模型,最值得做的一件事就是把每次调用的结果记下来。一个月之后你手上的那张表,会比任何测评都可信。