又挂两个,现在还能白嫖的就这 18 个
上个月我说 Groq 是最快的免费入口,545 毫秒,还建议排第一位。今天再跑,它限流了。在它之前坐这个位置的 Cerebras 八月底撞了付费墙,Mistral Large 这次也挂了。三周,最快的位置换了三次,前两名都掉了,现在坐第一的是智谱 GLM-4-Flash,788 毫秒。全量盘完是这样:直连各家从 8 个掉到 6 个,而 OpenRouter 的 free 池反而从 10 个涨到 13 个。18 个现在能用的入口全在文里,建议直接截图。
上个月我说 Groq 是最快的免费大模型入口,545 毫秒,还建议大家把它排在第一位。
今天再跑,它限流了。
而在它之前坐这个位置的 Cerebras,八月底撞上付费墙。再往前,Mistral Large 这次也挂了,返回的是「订阅层级不支持」。
三周,最快的位置换了三次,前两名都掉了。
现在坐在第一的是智谱 GLM-4-Flash,788 毫秒。它一个月前还是 1590 毫秒,中间一度慢到 2546,这次反而提速到了 788。
折腾一圈,跑到最后的是国产、国内直连、永久免费的那个。
先把现在能用的全给你,一共 18 个,建议直接截图存下来。

直连各家:还剩 6 个
这一档是你拿着各家 key 直接调的入口。
| 入口 | 耗时 | 8-27 时 |
|---|---|---|
| 智谱 GLM-4-Flash | 788ms | 2546ms,快了 3 倍 |
| Cloudflare oss-120b | 2108ms | 4205ms,快了一倍 |
| OpenRouter Nemotron | 2629ms | 1437ms |
| NVIDIA Ultra-550B | 7007ms | 1377ms,慢了 5 倍 |
| Kimi k2.6 | 8970ms | 11716ms |
| NVIDIA MiniMax-M3 | 17285ms | 之前限流,现在恢复 |
一周之内这一档从 8 个掉到 6 个。挂掉的三个是:
Groq oss-120b,限流。它上周还是全场最快。
Mistral Large,返回「This model is not available in your subscription tier」。注意这句话的性质,它不是限流不是欠费,是这个模型不在你这个订阅层级里,等不来。
NVIDIA Nemotron-49B,8 月 26 日 09:00 正式 EOL,现在直接返回 410 Gone。
OpenRouter 的 free 池:13 个,反而变多了
这一档是 OpenRouter 上带 :free 后缀的模型,一个 key 全都能调。

| 耗时 | 上下文 | 模型 |
|---|---|---|
| 1009ms | 262k | poolside/laguna-xs-2.1:free |
| 1135ms | 66k | liquid/lfm-2.5-2.6b:free |
| 1247ms | 256k | cohere/north-mini-code:free |
| 1332ms | 262k | nvidia/nemotron-3-super-120b-a12b:free |
| 1344ms | 1049k | minimax/minimax-m3:free |
| 1520ms | 128k | nvidia/nemotron-3.5-content-safety:free |
| 1666ms | 262k | google/gemma-4-31b-it:free |
| 1892ms | 262k | inclusionai/ling-3.0-flash-fin:free |
| 2404ms | 512k | dots-studio/dots-3-note-preview:free |
| 2555ms | 1000k | nvidia/nemotron-3-ultra-550b-a55b:free |
| 2597ms | 1000k | nvidia/nemotron-3.5-lightning:free |
| 2819ms | 256k | nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free |
| 3826ms | 197k | minimax/minimax-m2.7:free |
四天前我测这一批的时候,18 个里只有 10 个能用。今天变成 13 个。
活过来的三个:liquid/lfm-2.5-2.6b 和 google/gemma-4-31b-it 上次都是 Provider returned error,nvidia/nemotron-3.5-lightning 上次是超时 35 秒以上,这次 2597 毫秒就回来了。
还有五个仍然不行,其中 thinkingmachines 那两个是标了 free 但只在特定 agent 框架里开放,标准接口调不了,别浪费时间。
顺便记一个细节:Google 的两个 gemma-4,31b 这次活了,26b 还是 Provider error。同一家、同一个系列、相邻两个型号,可用性完全独立。判断能不能用只能一个一个试,不能按厂商整体推断。
一个反过来的现象
把两档放在一起看,这几天的变化是:
直连各家:8 个 → 6 个,净减 2。 OpenRouter free 池:10 个 → 13 个,净增 3。
一边在萎缩,一边在扩张。

想想也说得通。单家平台的免费层是纯成本,说关就关,Cerebras 的付费墙、Mistral 的订阅层级、Groq 的限流,都是这几天发生的,各家自己说了算。
而聚合平台的免费池子是各家上游轮流供货,某一家挂了,别家还在,整体反而更稳。
所以配置上我这次调整了顺序:主力挂聚合层,直连只留最稳的那个做兜底。
具体到今天的数据,我会这么排:
日常调用走 OpenRouter 的 free 池,从上面 13 个里挑,1009 到 1666 毫秒那一段有六七个可选,随便挂三个做轮换。
兜底留智谱 GLM-4-Flash。788 毫秒,国内直连不折腾网络,永久免费,而且它是这一个月里唯一没出过事的。
要长上下文的,OpenRouter 里有三个给到 100 万 token 以上,minimax-m3、nemotron-3-ultra、nemotron-3.5-lightning,都是免费的。
别再往 Groq 和 Mistral 上排主力。这两个这周刚掉,恢复了也先放备用位。
几句边界
这是一个账号、一个时间点的快照,2026 年 9 月 2 日。限流的那几个明天可能就好了,今天能用的明天也可能就限了,这类清单的保质期以天计。
「挂了」这一档要分清两种:GitHub 那两个和 Nemotron-49B 是服务本身退役,谁都用不了;而欠费、订阅层级、付费墙这几个,严格说是「我这个账号用不了」,换个账号或者充钱就能复活。
上下文长度是接口返回的标称值,我没有逐个压测验证真实可用长度。另外我只测了能不能正常返回,没测质量,也没跑穿额度。