DraftReviewPublishedArchived

免费大模型这 6 天:挂了 5 个,活了 3 个

6 天前我数了一遍还能白嫖的免费大模型,18 个,今天重跑变成 15 个。但不是简单少了 3 个:挂掉 5 个、活过来 3 个、新增 1 个,而活过来的那个现在是全场最快。这次我给所有返回 429 的入口都加了复打,隔 45 秒一轮打 4 轮,结果 Cloudflare 和 Groq 全部翻案,只打一轮的话今天最快的两个都会被我判死。另外 MiniMax 在免费这层基本整条线撤了,包括那个 1049k 上下文的。

By Joker2026/09/085 min

6 天前我数了一遍还能白嫖的免费大模型,18 个。今天重新跑了一遍,15 个。

但这不是简单地少了 3 个。这 6 天里挂掉 5 个,又活过来 3 个,还新冒出来 1 个。其中活过来的那个,现在是全场最快。

先说一件差点让我写错的事

今天第一轮扫描,Cloudflare 返回 429。

按以往的习惯,我该把它记进「挂了」那一栏。它 6 天前还是 2108 毫秒好好的,昨天我刚拿它连打过 15 次,一次没失手。突然 429,看着就像额度被我打完了。

我隔了几分钟又打,连打 3 次,全部正常。又隔 45 秒一轮、总共复打 4 轮,4 次全通,最快 1620 毫秒。

那个 429 是一个瞬时的限流窗口,不是挂了。

同一套复打,Groq 也翻案了。9 月 2 号那次我测到它 Rate limit reached,当时把它归进了挂掉的一栏。今天第一次打还是限流,复打 4 轮,4 次全通,579 毫秒。

所以这次我给所有返回 429 或者限流的入口都加了一道复打:隔 45 秒一轮,打 4 轮。结果是这样的:

入口第一轮复打 4 轮真实状态
Cloudflare4294/4 全通正常
Groq限流4/4 全通正常
NVIDIA MiniMax-M34290/4真的用不了
Cerebras付费墙0/4真的用不了
Mistral订阅层级0/4真的用不了

只打一轮的话,Cloudflare 和 Groq 都会被判死。而它们恰恰是今天最快的两个。

免费层的 429 和付费层的 429 不是一个意思。付费层限流通常是你真的超了配额,免费层的限流很多时候只是这一刻机器忙,过一会儿就好。区分方法很笨但有效:隔几十秒再打一次,多打几轮。

挂掉的 5 个,MiniMax 是整条线撤了

MiniMax-M3:6 天前从 NVIDIA 那个入口还能调,17285 毫秒,慢但能用。今天持续 429,复打 4 轮 0 比 4。

minimax/minimax-m3:free:从 OpenRouter 的模型列表里直接消失了。这个要多说一句,它 6 天前是整个免费列表里上下文最大的一个,1049k,一百万出头。想塞一整本书进去问问题,就它最合适。现在没了。

minimax/minimax-m2.7:free:同样从列表消失。

两个入口、三个型号,MiniMax 在免费这一层基本是整条线撤了。

poolside/laguna-xs-2.1:free:6 天前 1009 毫秒,是当时 :free 里最快的那个。今天 Provider returned error

google/gemma-4-31b-it:free:6 天前 1666 毫秒能用,今天同样是上游报错。这个有意思的地方在于,gemma-4 的另一个型号 26b 从 8 月 28 号起就一直报错,当时 31b 是好的。现在两个都趴下了。

顺带说一句,OpenRouter 上标 :free 的模型总数也在缩,6 天前 18 个,现在 16 个。

活过来的 3 个

Groq oss-120b,579 到 851 毫秒,4 轮全通。上面说过了,我 6 天前把它记进了挂掉那栏,这次它自己回来了。

智谱 GLM-4.7-Flash,6 天前是 120 秒超时、重试 3 次全败,今天 19191 毫秒能出结果。19 秒确实慢,但从「完全调不通」到「能出结果」是质变。

poolside/laguna-s-2.1:free,6 天前上游报错,今天 2609 毫秒。注意它跟上面挂掉的 laguna-xs 是同厂同系列,一个活了一个死了。同一家的不同型号,可用性完全独立,这个规律从 8 月底观察到现在一直成立。

另外还新增了一个 inclusionai/ling-3.0-flash-sante:free,1319 毫秒,6 天前列表里还没有它。

还有第三种状态,比挂掉更坑

免费模型不是只有「能用」和「不能用」两种状态。还有一种是名义上活着,但慢到你不想用

nemotron-3-ultra-550b 就是这次的典型。

入口09-02今天倍数
OpenRouter2629ms37407ms慢 14 倍
NVIDIA 直连7007ms35328ms慢 5 倍

它没报错,接口也没下架,你调它它就回你,只是要等半分多钟。

两个完全不同的入口同时变慢,说明问题出在模型自己身上,不是某一家的路由或者限流。

我这次把可用的门槛定在 35 秒,超过 35 秒就算不可用,所以它两个入口都被划出去了。这个 35 秒是我自己定的口径,不是什么官方标准。但你要真在代码里等它 37 秒,那条链路基本也废了。

最快的那个位置,一个月换了四次

把这一个月的记录连起来看,挺有意思:

  • 8 月 17 日:Cerebras gpt-oss-120b,593 毫秒
  • 8 月 25 日:Cerebras 撞付费墙,Groq 顶上,545 毫秒
  • 9 月 2 日:Groq 限流,智谱 GLM-4-Flash 顶上,788 毫秒
  • 9 月 8 日:Groq 回来了,579 毫秒,重新排第一

前三次都是「上一个挂了,下一个顶上」。这一次是挂掉的那个自己回来了,把位置又抢了回去。

这个节奏说明一件事:免费层的排名是没有惯性的。你这个月记住的最快,下个月大概率不是它。真要用,别在代码里写死某一个,写个能自动切换的列表。

现在还能用的 15 个

直连的 5 个:Groq oss-120b(579ms)、智谱 GLM-4-Flash(1040ms)、Cloudflare oss-120b(1620ms)、Kimi k2.6(3910ms)、智谱 GLM-4.7-Flash(19191ms)。

OpenRouter 上标 :free 的 10 个,按快慢排:ling-3.0-flash-fin(1192ms)、ling-3.0-flash-sante(1319ms)、nemotron-3-super-120b-a12b(1519ms)、nemotron-3-nano-omni-30b-a3b-reasoning(1721ms)、lfm-2.5-2.6b(1884ms)、north-mini-code(2177ms)、nemotron-3.5-content-safety(2602ms)、laguna-s-2.1(2609ms)、dots-3-note-preview(2787ms)、nemotron-3.5-lightning(16568ms)。

要长上下文的话,nemotron-3.5-lightning 标称 1000k,dots-3-note-preview 512k。前者 16 秒,忍一下还能用。原来那个 1049k 的 minimax-m3 已经没了。

怎么配

别在代码里写死一个。这一个月第一名换了四次,写死哪个都不对。列一串,失败就往下切。

429 别当成挂了,先重试。今天 Cloudflare 和 Groq 都是这么翻案的,一次限流就放弃,等于白扔两个最快的。退避重试几轮,成本很低。

把「慢到不能用」也算进失败。只判断有没有报错是不够的,nemotron-3-ultra 那种 37 秒的响应,接口层面完全正常,业务上早就废了。给你的调用加个超时,超了就切下一个。

同一家的不同型号要分开测。laguna 系列一个活一个死,gemma-4 两个型号先后趴下,这种事这一个月见过好几次。别因为一个型号不行就把整家划掉。

几句边界

这是一个账号在一个时间点的快照。免费层的额度按账号算,你的结果和我的可能不一样,尤其是限流这块。

35 秒的可用门槛是我定的,换个门槛,可用数量会变。

只测了能不能正常返回,没测输出质量,也没跑穿额度看能白嫖多少。

「挂掉」这一栏里,NVIDIA Nemotron-49B 是官方退役,返回里写明了 2026 年 8 月 26 日 end of life,这个是确定的;付费墙、订阅层级、额度限流这几种,换个账号可能就是好的。

各家的策略改得很勤,从 9 月 2 号到今天 6 天,18 个变 15 个,中间还有 5 挂 3 活的来回。这份名单的保质期,大概也就一周。

QUEST COMPLETEREWARD: +30 XP, +1 EPIC ITEM
Build Progress100%
无信号
PULSE
0PULSES