DraftReviewPublishedArchived

又挂两个,现在还能白嫖的就这 18 个

上个月我说 Groq 是最快的免费入口,545 毫秒,还建议排第一位。今天再跑,它限流了。在它之前坐这个位置的 Cerebras 八月底撞了付费墙,Mistral Large 这次也挂了。三周,最快的位置换了三次,前两名都掉了,现在坐第一的是智谱 GLM-4-Flash,788 毫秒。全量盘完是这样:直连各家从 8 个掉到 6 个,而 OpenRouter 的 free 池反而从 10 个涨到 13 个。18 个现在能用的入口全在文里,建议直接截图。

By Joker2026/09/025 min

上个月我说 Groq 是最快的免费大模型入口,545 毫秒,还建议大家把它排在第一位。

今天再跑,它限流了。

而在它之前坐这个位置的 Cerebras,八月底撞上付费墙。再往前,Mistral Large 这次也挂了,返回的是「订阅层级不支持」。

三周,最快的位置换了三次,前两名都掉了。

现在坐在第一的是智谱 GLM-4-Flash,788 毫秒。它一个月前还是 1590 毫秒,中间一度慢到 2546,这次反而提速到了 788。

折腾一圈,跑到最后的是国产、国内直连、永久免费的那个。

先把现在能用的全给你,一共 18 个,建议直接截图存下来。

直连各家:还剩 6 个

这一档是你拿着各家 key 直接调的入口。

入口耗时8-27 时
智谱 GLM-4-Flash788ms2546ms,快了 3 倍
Cloudflare oss-120b2108ms4205ms,快了一倍
OpenRouter Nemotron2629ms1437ms
NVIDIA Ultra-550B7007ms1377ms,慢了 5 倍
Kimi k2.68970ms11716ms
NVIDIA MiniMax-M317285ms之前限流,现在恢复

一周之内这一档从 8 个掉到 6 个。挂掉的三个是:

Groq oss-120b,限流。它上周还是全场最快。

Mistral Large,返回「This model is not available in your subscription tier」。注意这句话的性质,它不是限流不是欠费,是这个模型不在你这个订阅层级里,等不来。

NVIDIA Nemotron-49B,8 月 26 日 09:00 正式 EOL,现在直接返回 410 Gone。

OpenRouter 的 free 池:13 个,反而变多了

这一档是 OpenRouter 上带 :free 后缀的模型,一个 key 全都能调。

耗时上下文模型
1009ms262kpoolside/laguna-xs-2.1:free
1135ms66kliquid/lfm-2.5-2.6b:free
1247ms256kcohere/north-mini-code:free
1332ms262knvidia/nemotron-3-super-120b-a12b:free
1344ms1049kminimax/minimax-m3:free
1520ms128knvidia/nemotron-3.5-content-safety:free
1666ms262kgoogle/gemma-4-31b-it:free
1892ms262kinclusionai/ling-3.0-flash-fin:free
2404ms512kdots-studio/dots-3-note-preview:free
2555ms1000knvidia/nemotron-3-ultra-550b-a55b:free
2597ms1000knvidia/nemotron-3.5-lightning:free
2819ms256knvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free
3826ms197kminimax/minimax-m2.7:free

四天前我测这一批的时候,18 个里只有 10 个能用。今天变成 13 个。

活过来的三个:liquid/lfm-2.5-2.6bgoogle/gemma-4-31b-it 上次都是 Provider returned error,nvidia/nemotron-3.5-lightning 上次是超时 35 秒以上,这次 2597 毫秒就回来了。

还有五个仍然不行,其中 thinkingmachines 那两个是标了 free 但只在特定 agent 框架里开放,标准接口调不了,别浪费时间。

顺便记一个细节:Google 的两个 gemma-4,31b 这次活了,26b 还是 Provider error。同一家、同一个系列、相邻两个型号,可用性完全独立。判断能不能用只能一个一个试,不能按厂商整体推断。

一个反过来的现象

把两档放在一起看,这几天的变化是:

直连各家:8 个 → 6 个,净减 2。 OpenRouter free 池:10 个 → 13 个,净增 3。

一边在萎缩,一边在扩张。

想想也说得通。单家平台的免费层是纯成本,说关就关,Cerebras 的付费墙、Mistral 的订阅层级、Groq 的限流,都是这几天发生的,各家自己说了算。

而聚合平台的免费池子是各家上游轮流供货,某一家挂了,别家还在,整体反而更稳。

所以配置上我这次调整了顺序:主力挂聚合层,直连只留最稳的那个做兜底。

具体到今天的数据,我会这么排:

日常调用走 OpenRouter 的 free 池,从上面 13 个里挑,1009 到 1666 毫秒那一段有六七个可选,随便挂三个做轮换。

兜底留智谱 GLM-4-Flash。788 毫秒,国内直连不折腾网络,永久免费,而且它是这一个月里唯一没出过事的。

要长上下文的,OpenRouter 里有三个给到 100 万 token 以上,minimax-m3、nemotron-3-ultra、nemotron-3.5-lightning,都是免费的。

别再往 Groq 和 Mistral 上排主力。这两个这周刚掉,恢复了也先放备用位。

几句边界

这是一个账号、一个时间点的快照,2026 年 9 月 2 日。限流的那几个明天可能就好了,今天能用的明天也可能就限了,这类清单的保质期以天计。

「挂了」这一档要分清两种:GitHub 那两个和 Nemotron-49B 是服务本身退役,谁都用不了;而欠费、订阅层级、付费墙这几个,严格说是「我这个账号用不了」,换个账号或者充钱就能复活。

上下文长度是接口返回的标称值,我没有逐个压测验证真实可用长度。另外我只测了能不能正常返回,没测质量,也没跑穿额度。

QUEST COMPLETEREWARD: +30 XP, +1 EPIC ITEM
Build Progress100%
无信号
PULSE
0PULSES