免费大模型,谁还能直接用,谁得先掏钱
隔了几天把手上这批入口重新过了一遍:能直接调出结果的 6 个,得先掏钱才能用的 3 个,还有 1 个模型没了。最快的 Groq 605 毫秒,最慢的 NVIDIA 将近 32 秒,差 53 倍,但在任何一份「还能白嫖」的清单里它们都算同一档。另外 Kimi 慢了三倍多,从 3.9 秒掉到 13.9 秒,我复测了 5 轮确认不是抖动。还有三个都在报「要钱」的,但一个是额度用完、一个是一开始就要绑卡、一个是订阅层级不够,处理方式完全不同。
隔了几天没测,今天把手上这批入口重新过了一遍。
结论先放这儿:能直接调出结果的 6 个,得先掏钱才能用的 3 个,还有 1 个模型已经没了。
另外有一个我没想到的变化,Kimi 慢了三倍多。

能直接用的 6 个
| 入口 | 今天 | 上次 |
|---|---|---|
| Groq oss-120b | 605ms | 579ms |
| Cloudflare oss-120b | 1204ms | 1620ms |
| OpenRouter ling-3.0-flash-fin | 1248ms | 1192ms |
| 智谱 GLM-4-Flash | 2297ms | 1040ms |
| Kimi k2.6 | 13921ms | 3910ms |
| NVIDIA NIM | 31962ms | 35328ms |
最快的 605 毫秒,最慢的将近 32 秒,差 53 倍。
这六个在任何一份「还能白嫖的清单」里都会被算成同一档,都叫能用。但你要是照着清单随手挑一个接进去,挑到 Groq 和挑到 NVIDIA,完全是两种体验。
前四个都在 2.3 秒以内,跑正事没问题。Kimi 要等十几秒。NVIDIA 那 32 秒,放进任何有人在等结果的流程里都是废的。
Kimi 慢了三倍多,而且是稳的
第一轮扫出来 22.5 秒的时候我以为是抖动,因为它 9 月 10 号还是 3.9 秒。
所以单独复测了 5 轮,每轮间隔 15 秒:
13882ms、12470ms、13921ms、16633ms、15418ms。
5 次全部成功,中位 13921 毫秒,最快 12.4 秒最慢 16.6 秒。
不是抖动,是稳定地慢了下来。从 3.9 秒到 13.9 秒,三倍多。

之前翻长期记录的时候发现过一个规律:这些入口停服之前,往往会先变慢。不是说 Kimi 要停,它现在好好的,5 次调用一次没失手。只是如果你的流程里排了它,现在这个耗时该重新算一遍了。
得先掏钱的 3 个,三种掏法
这三个报错都是关于钱的,但意思完全不一样。
Cerebras:先给你用,用完要钱。
Payment required to access this resource. Visit your billing tab.
它是免费额度用光了撞上付费墙。这种最好理解,也最常见。
SambaNova:一开始就要绑卡。
A payment method is required. Add one at ... to continue.
注意这个跟 Cerebras 不是一回事。它不是让你用完了再付,是你不绑支付方式,一次都调不了。对只想白嫖的人来说,这家从一开始就不在名单里。
Mistral:这个型号不在你这档。
This model is not available in your subscription tier
这是分层,不是额度。跟你用了多少没关系,是这个型号本身就要更高的订阅层级。换个小一点的型号也许就能用。
分清这三种有实际意义:额度用完的等重置或者换家;要绑卡的直接划掉;订阅层级不够的可以试试换型号。
有两个不算数,是我自己账号的问题
这次还有两个调不通:火山方舟和硅基流动。
火山返回的是账户欠费,硅基流动返回的是余额不足。
这两条跟平台的免费政策没关系,是我这两个账号自己空了。
我把它们单独拎出来说,是因为这类报错和上面那三个长得很像,都在讲钱,但性质完全相反:上面三个是平台设的门,这两个是我自己没交钱。

这事在看任何「哪些还能免费用」的清单时都值得留个心眼。别人测出来「某某家用不了」,有可能是那家真的变了,也有可能只是他那个账号欠费了。这两种情况在报错里分不出来,只能靠测的人自己说清楚。
还有 1 个是模型没了
ModelScope 上的 DeepSeek-V4-Flash,返回的是:
Model id : deepseek-ai/DeepSeek-V4-Flash , has no provider supported
没有供应方了。这不是收费问题,是这个型号在这个平台上没人提供了。
所以现在怎么挑
跑正事就在前四个里选:Groq、Cloudflare、OpenRouter、智谱,都在 2.3 秒以内。Groq 依然最快。
Kimi 先重新计时再决定。它能用,但十几秒的响应跟三个月前不是一回事了。
NVIDIA 只适合离线任务。32 秒,没人等得起。
看到「要钱」先分类。额度用完、要绑卡、订阅层级,三种处理方式完全不同。
还要再分一层:是平台的门槛,还是你自己账号欠费。搞错了要么白等,要么白换家。
几句边界
一个账号、一个时间点的快照。免费额度是按账号算的,你的数字会和我的不一样。
只覆盖我自己网关里配的这些入口,不是全市场普查,肯定有我没测到的。
只测了能不能正常返回和耗时,没测输出质量。
速度受当时网络和平台负载影响,单次数字别当长期水平看。Kimi 那条我是复测 5 轮才敢写的,其他几个都是单次,仅供参考。
火山和硅基流动那两条是我账号自己的问题,不构成对这两家免费政策的任何判断。