免费大模型连测 22 天,全勤的只有 3 个
从 8 月 17 日到 9 月 8 日,22 天,同一批免费大模型入口我完整测了 5 次,同一份脚本同一道题。21 个入口里 5 次全部可用的只有 3 个。把 5 次记录叠起来看,能看出单次测试根本看不到的东西:活下来的那 3 个共同点是「常驻免费档」而不是「免费额度」;死掉的那些里,有一类死前会先变慢,Nemotron-49B 慢了 5 倍之后第二天就官方停服了;而限流型的报错基本都会自己活过来,Groq 22 天里横跳 4 次,两次复活都直接拿了第一。
从 8 月 17 日到 9 月 8 日,22 天,我把同一批免费大模型入口完整测了 5 次。同一份脚本、同一道题、同样的参数。
21 个入口,5 次全部可用的,只有 3 个。

这篇不讲今天哪个能用,那种名单我写过好几次,保质期就一周。这次讲的是把 5 次记录叠在一起之后,能看出来的东西:什么样的免费入口活得久,什么样的会突然没,以及死之前有没有征兆。
全勤的 3 个
智谱 GLM-4-Flash、Cloudflare 的 oss-120b、Kimi k2.6。
| 入口 | 8-17 | 8-25 | 9-02 | 9-04 | 9-08 |
|---|---|---|---|---|---|
| 智谱 GLM-4-Flash | 3827ms | 2546ms | 788ms | 1634ms | 1040ms |
| Cloudflare oss-120b | 2109ms | 4205ms | 2108ms | 2512ms | 1620ms |
| Kimi k2.6 | 10541ms | 11716ms | 8970ms | 10877ms | 3910ms |
速度都有波动,智谱在 788 到 3827 之间晃,Kimi 一直慢但这次快了不少。可它们 5 次一次没掉过线。
我一开始以为这只是运气。把死掉的那批拉出来对照才发现,这 3 个有个共同点:它们给的都是「常驻免费档」,不是「免费额度」。
这个区别很要命。
常驻免费档是平台长期开着的一个位置,用来拉人进来。它不承诺你能用多少,但这个档位一直在。
免费额度是给你一笔量,用完为止。
死掉的那批基本都是后者:
Cerebras 给的是免费额度,8 月 17 日它还是全场最快 593 毫秒,我当时明确推荐首选。8 天后再测,Payment required to access this resource。额度到头了。
Mistral 走的是订阅层级,This model is not available in your subscription tier。
SambaNova 更直接,要求先绑支付方式才让调。
所以挑免费入口的时候,先看它是哪一种。额度型是消耗品,你只是还没用完;常驻档是平台的获客位,它有动机一直开着。这个判断比看谁快有用得多。
死之前,它会先变慢
这是这次翻记录翻出来的、我自己也没料到的一条。
NVIDIA 的 Nemotron-49B 是最干净的样本:
8 月 17 日,2534 毫秒,正常。 8 月 25 日,15574 毫秒,慢了 5 倍,但还能用。 8 月 26 日,官方 EOL,返回里带明确日期。 之后再测,410 Gone。
变慢和停服之间只隔了一天。
我当时看到 15574 毫秒只当它那天网络不好,没多想。现在回头看,那就是它咽气前的样子。
更要命的是,现在有两个入口正走在同一条曲线上:
| 入口 | 8-17 | 8-25 | 9-02 | 9-04 | 9-08 |
|---|---|---|---|---|---|
| NVIDIA Ultra-550B | 2863ms | 1377ms | 7007ms | 8257ms | 35328ms |
| OpenRouter Nemotron | 2318ms | 1437ms | 2629ms | 9873ms | 37407ms |
连续两期变慢,最后一期直接冲到 35 秒以上。

这两个是同一个模型的两个不同入口,一起变慢。说明问题出在模型自己身上,不是某一家的路由或者限流。
它们到现在一次错都没报过。你调它,它回你,只是要等半分钟。接口层面完全健康,监控不会响,业务上早就废了。
连续两期变慢,就该准备后路了。这是唯一一种有前兆的死法,但它不会给你报错,只能靠定期测量才能发现。
三种死法,能不能活过来完全不同
看到报错先别急着划掉,先分类。
| 死法 | 报错长什么样 | 22 天里复活了吗 |
|---|---|---|
| 限流型 | Rate limit reached、429 | 都活了 |
| 额度/付费墙型 | Payment required、订阅层级不够 | 一个没回来 |
| 退役型 | end of life、410 Gone | 不可能回来 |
Groq 这一路最能说明问题:
8 月 17 日限流,我判它挂了。 8 月 25 日可用,545 毫秒,全场最快。 9 月 2 日又限流,我又判它挂了。 9 月 4 日可用。 9 月 8 日可用,579 毫秒,重回第一。
22 天里横跳 4 次,最后活着,而且两次复活都是直接拿第一。
智谱的 GLM-4.7-Flash 更极端。8 月 17 日限流、8 月 25 日限流、9 月 2 日超时 120 秒重试三次全败,我连着三期把它记进死亡名单。9 月 4 日突然通了,要 75 秒。9 月 8 日 19 秒。
连挂三期之后活过来,而且在变快。
反过来,Cerebras 撞付费墙之后 22 天没回来过,Mistral 掉进订阅层级之后也没回来过。这两类是不会自己好的。
所以:限流就等,付费墙就换家,EOL 就直接删掉。把限流当死亡处理,代价是白扔掉最快的那个,我已经扔过两次了。

第一名换了 4 次,前三任都死过
| 日期 | 第一名 | 耗时 | 上一任怎么下去的 |
|---|---|---|---|
| 8-17 | Cerebras | 593ms | 首测基准 |
| 8-25 | Groq | 545ms | Cerebras 撞付费墙 |
| 9-02 | 智谱 GLM-4-Flash | 788ms | Groq 限流 |
| 9-04 | Groq | 598ms | 智谱慢到 1634ms |
| 9-08 | Groq | 579ms | 卫冕 |
22 天换了 4 次,平均五天半一换。
这个节奏说明,任何「谁最快」的结论保质期就是几天,包括我自己写的那些。真要用,别信排名,信一个能自动切换的列表。
四条可以直接用的
依赖常驻免费档,不依赖免费额度。额度是消耗品,你只是还没用完;常驻档是平台的获客位,它有动机一直开着。全勤的 3 个全是后者。
同一个模型配多个平台入口。gpt-oss-120b 在 Cerebras、Groq、Cloudflare 三家都有,这 22 天里至少有一家是活的,从来没有同时全挂过。换平台请求体基本不用改,换模型要改代码,成本差很远。
连续两期变慢就准备后路。性能衰减是唯一有前兆的死法,代价是它不报错。给调用加个超时,超了就切下一个,别等它给你返回错误。
限流不是死亡,退避重试。隔几十秒再打,多打几轮。Groq 两次复活后都立刻拿了第一,我两次都差点错过。
几句边界
这是一个账号在 5 个时间点的记录。免费层的额度按账号算,你的结果会和我的不一样,限流这块尤其明显。
「不可用」里混了两类。服务本身没了的,比如 GitHub Models 退役、Nemotron-49B 有明确 EOL 日期,这个是确定的;还有一类是我这个账号用不了,比如欠费、订阅层级、额度打完,这种换个账号可能就是好的。正文里我尽量分开写了。
9 月 8 日那次起我把可用门槛定在 35 秒,前面几期没有这个门槛。所以 Ultra-550B 和 OpenRouter Nemotron 在最后一期判为不可用,严格说是「慢到不能用」,不是「调不通」。
只测了能不能正常返回,没测输出质量,也没跑穿额度看能白嫖多少。
这 21 个入口是我自己网关里配的,不是全市场普查。市面上肯定还有我没测到的。