免费大模型这 6 天:挂了 5 个,活了 3 个
6 天前我数了一遍还能白嫖的免费大模型,18 个,今天重跑变成 15 个。但不是简单少了 3 个:挂掉 5 个、活过来 3 个、新增 1 个,而活过来的那个现在是全场最快。这次我给所有返回 429 的入口都加了复打,隔 45 秒一轮打 4 轮,结果 Cloudflare 和 Groq 全部翻案,只打一轮的话今天最快的两个都会被我判死。另外 MiniMax 在免费这层基本整条线撤了,包括那个 1049k 上下文的。
6 天前我数了一遍还能白嫖的免费大模型,18 个。今天重新跑了一遍,15 个。
但这不是简单地少了 3 个。这 6 天里挂掉 5 个,又活过来 3 个,还新冒出来 1 个。其中活过来的那个,现在是全场最快。

先说一件差点让我写错的事
今天第一轮扫描,Cloudflare 返回 429。
按以往的习惯,我该把它记进「挂了」那一栏。它 6 天前还是 2108 毫秒好好的,昨天我刚拿它连打过 15 次,一次没失手。突然 429,看着就像额度被我打完了。
我隔了几分钟又打,连打 3 次,全部正常。又隔 45 秒一轮、总共复打 4 轮,4 次全通,最快 1620 毫秒。
那个 429 是一个瞬时的限流窗口,不是挂了。
同一套复打,Groq 也翻案了。9 月 2 号那次我测到它 Rate limit reached,当时把它归进了挂掉的一栏。今天第一次打还是限流,复打 4 轮,4 次全通,579 毫秒。
所以这次我给所有返回 429 或者限流的入口都加了一道复打:隔 45 秒一轮,打 4 轮。结果是这样的:
| 入口 | 第一轮 | 复打 4 轮 | 真实状态 |
|---|---|---|---|
| Cloudflare | 429 | 4/4 全通 | 正常 |
| Groq | 限流 | 4/4 全通 | 正常 |
| NVIDIA MiniMax-M3 | 429 | 0/4 | 真的用不了 |
| Cerebras | 付费墙 | 0/4 | 真的用不了 |
| Mistral | 订阅层级 | 0/4 | 真的用不了 |
只打一轮的话,Cloudflare 和 Groq 都会被判死。而它们恰恰是今天最快的两个。
免费层的 429 和付费层的 429 不是一个意思。付费层限流通常是你真的超了配额,免费层的限流很多时候只是这一刻机器忙,过一会儿就好。区分方法很笨但有效:隔几十秒再打一次,多打几轮。
挂掉的 5 个,MiniMax 是整条线撤了

MiniMax-M3:6 天前从 NVIDIA 那个入口还能调,17285 毫秒,慢但能用。今天持续 429,复打 4 轮 0 比 4。
minimax/minimax-m3:free:从 OpenRouter 的模型列表里直接消失了。这个要多说一句,它 6 天前是整个免费列表里上下文最大的一个,1049k,一百万出头。想塞一整本书进去问问题,就它最合适。现在没了。
minimax/minimax-m2.7:free:同样从列表消失。
两个入口、三个型号,MiniMax 在免费这一层基本是整条线撤了。
poolside/laguna-xs-2.1:free:6 天前 1009 毫秒,是当时 :free 里最快的那个。今天 Provider returned error。
google/gemma-4-31b-it:free:6 天前 1666 毫秒能用,今天同样是上游报错。这个有意思的地方在于,gemma-4 的另一个型号 26b 从 8 月 28 号起就一直报错,当时 31b 是好的。现在两个都趴下了。
顺带说一句,OpenRouter 上标 :free 的模型总数也在缩,6 天前 18 个,现在 16 个。
活过来的 3 个
Groq oss-120b,579 到 851 毫秒,4 轮全通。上面说过了,我 6 天前把它记进了挂掉那栏,这次它自己回来了。
智谱 GLM-4.7-Flash,6 天前是 120 秒超时、重试 3 次全败,今天 19191 毫秒能出结果。19 秒确实慢,但从「完全调不通」到「能出结果」是质变。
poolside/laguna-s-2.1:free,6 天前上游报错,今天 2609 毫秒。注意它跟上面挂掉的 laguna-xs 是同厂同系列,一个活了一个死了。同一家的不同型号,可用性完全独立,这个规律从 8 月底观察到现在一直成立。
另外还新增了一个 inclusionai/ling-3.0-flash-sante:free,1319 毫秒,6 天前列表里还没有它。
还有第三种状态,比挂掉更坑
免费模型不是只有「能用」和「不能用」两种状态。还有一种是名义上活着,但慢到你不想用。
nemotron-3-ultra-550b 就是这次的典型。
| 入口 | 09-02 | 今天 | 倍数 |
|---|---|---|---|
| OpenRouter | 2629ms | 37407ms | 慢 14 倍 |
| NVIDIA 直连 | 7007ms | 35328ms | 慢 5 倍 |
它没报错,接口也没下架,你调它它就回你,只是要等半分多钟。
两个完全不同的入口同时变慢,说明问题出在模型自己身上,不是某一家的路由或者限流。
我这次把可用的门槛定在 35 秒,超过 35 秒就算不可用,所以它两个入口都被划出去了。这个 35 秒是我自己定的口径,不是什么官方标准。但你要真在代码里等它 37 秒,那条链路基本也废了。
最快的那个位置,一个月换了四次
把这一个月的记录连起来看,挺有意思:
- 8 月 17 日:Cerebras gpt-oss-120b,593 毫秒
- 8 月 25 日:Cerebras 撞付费墙,Groq 顶上,545 毫秒
- 9 月 2 日:Groq 限流,智谱 GLM-4-Flash 顶上,788 毫秒
- 9 月 8 日:Groq 回来了,579 毫秒,重新排第一
前三次都是「上一个挂了,下一个顶上」。这一次是挂掉的那个自己回来了,把位置又抢了回去。
这个节奏说明一件事:免费层的排名是没有惯性的。你这个月记住的最快,下个月大概率不是它。真要用,别在代码里写死某一个,写个能自动切换的列表。

现在还能用的 15 个
直连的 5 个:Groq oss-120b(579ms)、智谱 GLM-4-Flash(1040ms)、Cloudflare oss-120b(1620ms)、Kimi k2.6(3910ms)、智谱 GLM-4.7-Flash(19191ms)。
OpenRouter 上标 :free 的 10 个,按快慢排:ling-3.0-flash-fin(1192ms)、ling-3.0-flash-sante(1319ms)、nemotron-3-super-120b-a12b(1519ms)、nemotron-3-nano-omni-30b-a3b-reasoning(1721ms)、lfm-2.5-2.6b(1884ms)、north-mini-code(2177ms)、nemotron-3.5-content-safety(2602ms)、laguna-s-2.1(2609ms)、dots-3-note-preview(2787ms)、nemotron-3.5-lightning(16568ms)。
要长上下文的话,nemotron-3.5-lightning 标称 1000k,dots-3-note-preview 512k。前者 16 秒,忍一下还能用。原来那个 1049k 的 minimax-m3 已经没了。
怎么配
别在代码里写死一个。这一个月第一名换了四次,写死哪个都不对。列一串,失败就往下切。
429 别当成挂了,先重试。今天 Cloudflare 和 Groq 都是这么翻案的,一次限流就放弃,等于白扔两个最快的。退避重试几轮,成本很低。
把「慢到不能用」也算进失败。只判断有没有报错是不够的,nemotron-3-ultra 那种 37 秒的响应,接口层面完全正常,业务上早就废了。给你的调用加个超时,超了就切下一个。
同一家的不同型号要分开测。laguna 系列一个活一个死,gemma-4 两个型号先后趴下,这种事这一个月见过好几次。别因为一个型号不行就把整家划掉。
几句边界
这是一个账号在一个时间点的快照。免费层的额度按账号算,你的结果和我的可能不一样,尤其是限流这块。
35 秒的可用门槛是我定的,换个门槛,可用数量会变。
只测了能不能正常返回,没测输出质量,也没跑穿额度看能白嫖多少。
「挂掉」这一栏里,NVIDIA Nemotron-49B 是官方退役,返回里写明了 2026 年 8 月 26 日 end of life,这个是确定的;付费墙、订阅层级、额度限流这几种,换个账号可能就是好的。
各家的策略改得很勤,从 9 月 2 号到今天 6 天,18 个变 15 个,中间还有 5 挂 3 活的来回。这份名单的保质期,大概也就一周。