免费大模型能白嫖多少次?最多 300,最少 3
之前写免费大模型,我每次都在文末交代一句「没跑穿额度」,这个坑留了一个多月,今天补上:对每个入口连着调,一直调到它把我拦住。结果差距大到我自己愣了一下,智谱打了 300 次一声不吭,Kimi 第 4 次就把我踢出来。中间还挖到一件我之前完全没意识到的事:OpenRouter 上那 16 个标 free 的模型共享同一个每日额度,大概 50 次,打完之后 16 个一起挂,换没碰过的模型也照样被拦。Cloudflare 的 10000 neurons 也是账号级的。
之前写免费大模型,我每次都在文末老实交代一句:只测了能不能调通,没跑穿额度。
这个坑留了一个多月。今天补上。
做法很简单粗暴:对每个入口连着调,一直调到它把我拦住为止。
结果差距大到我自己都愣了一下。同样是免费,有的我打了 300 次它一声不吭,有的第 4 次就把我踢出来了。

先看数字
| 入口 | 打到第几次被拦 | 中位延迟 |
|---|---|---|
| 智谱 GLM-4-Flash | 300 次没被拦 | 1498ms |
| Cloudflare oss-120b | 165 | 1975ms |
| OpenRouter ling-3.0-flash-fin | 39 | 1081ms |
| OpenRouter nemotron-3-super | 17 | 1929ms |
| Kimi k2.6 | 4 | 4861ms |
智谱那个 300 得说清楚:那是我自己设的上限,不是它的上限。跑满 300 次它没有任何反应,所以它的真实额度这次没测出来。550 秒里连着问了 300 个问题,一次没拦。
今天最值钱的一条:一堆免费模型,共用一份额度
OpenRouter 那两行数字,一个断在 39 次,一个断在 17 次。
我一开始的理解是「这个模型额度少,那个模型额度多」。直到看清报错:
Rate limit exceeded: free-models-per-day
是 free-models-per-day,不是某个模型的限制。
38 加 16,正好 54 次。
那就得验证一下。我换了 3 个今天完全没碰过的模型再打:
| 模型 | 结果 |
|---|---|
| cohere/north-mini-code:free | 一模一样的 free-models-per-day |
| liquid/lfm-2.5-2.6b:free | 一模一样 |
| nvidia/nemotron-3.5-content-safety:free | 一模一样 |
坐实了。OpenRouter 上那 16 个标 :free 的模型,共享同一个每日额度,大概 50 次。

这件事的意思是:你打开 OpenRouter 看到十几个免费模型,觉得资源真丰富。实际上它们后面接的是同一个计数器。你在 A 模型上花掉的次数,B 模型就没了。打完 50 次,16 个全部一起挂,不是只挂你用过的那两个。
Cloudflare 是同一个套路。它拦我的时候说:
you have used up your daily free allocation of 10,000 neurons
我换成另外两个小模型再打,返回一字不差。10000 neurons 是账号级的,不是每个模型一份。
实测 164 次打完这 10000 neurons,平均每次 61 个左右。
所以这里有个反常识的结论:模型数量不等于可用量。
智谱只有一个免费模型,我打了 300 次没停。OpenRouter 有 16 个,加起来每天 50 次。一个不限量的,比十六个共享 50 次的实用得多。
Groq 这个要单独说,我差点又判错
打爆测试里 Groq 的成绩是 0 次成功,第 1 次就被拦。
但它昨天还是 4 轮全通、579 毫秒。0 次成功这个数字要是直接写出去,等于告诉你 Groq 不能用,那是错的。
所以复打,隔 40 秒一轮,打 5 轮:
| 轮次 | 结果 |
|---|---|
| 第 1 轮 | 成功,619ms |
| 第 2 轮 | 限流,226ms |
| 第 3 轮 | 成功,642ms |
| 第 4 轮 | 限流,225ms |
| 第 5 轮 | 成功,655ms |
成功的都在 620 到 655 毫秒,被拦的都是 225 毫秒秒回。隔一次拦一次。
Groq 不是「额度打完了」,是持续的细粒度限流。它一直可用,只是实际吞吐要打对折。打爆测试里它 0 次成功,是因为前面刚打过一轮,正好落在限流窗口里。
这已经是这几天第三次了。前天 Cloudflare 第一轮 429 我差点判它挂了,昨天翻记录发现 Groq 被我误判过两次。免费层的限流报错,不复打就下结论,基本都会错。
Kimi 每分钟 3 次,两次测的结果一样
第 4 次就 429,返回里写明每分钟 3 次。
8 月 27 号我测过一次,也是第 4 个被拦。两次隔了半个月,结果完全一致,说明这是稳定的策略,不是那天正好赶上。
两种限制,应对完全不一样
这次跑下来,卡人的方式分两类,混在一起看就乱了。

速率型:一段时间内最多多少次。Kimi 每分钟 3 次,Groq 隔次限流。 特点是总量不封顶,放慢就能用满。Kimi 你要是每 20 秒问一次,一天下来能问 4000 多次。
总量型:每天就这么多,用完为止。Cloudflare 10000 neurons,OpenRouter 50 次。 特点是放慢也没用,打完只能等第二天重置。
搞混的代价挺实际的:你以为放慢就能省着用,结果那家是总量型,慢慢用也是那么多次;或者你以为额度打完了就放弃,结果那家是速率型,等 30 秒就能接着用。
所以怎么配
要跑批量任务,用智谱。这次唯一没测到上限的,300 次连着打没有任何拦截。
OpenRouter 别当额度池。它的价值是「你想试某个特定的模型」,不是「这儿有很多免费额度」。16 个模型共享 50 次,均摊下来每个模型 3 次。
Cloudflare 适合日常零散用。每天 164 次,一个人正常问答完全够,但你要拿它跑批量,一次就打光了。
Kimi 只能串行,两次请求之间留够 20 秒。
Groq 的限流别当挂了,重试就有,成功的那几次都是 600 毫秒出头,是这批里最快的。
几句边界
一个账号、一天之内的测试。免费额度是按账号算的,你的数字会跟我的不一样。
智谱那个 300 次是我设的上限,不是它的额度上限。它到底给多少,这次没测出来,后面找机会再往上加。
max_tokens 统一设的 150,所以输出字数受这个限制,不能拿来当「能写多少字」的依据。
Cloudflare 每次消耗多少 neurons 跟模型和输出长度有关,61 这个数是这次这个配置下的平均值,换个模型就变了。
最后说个实际的:这种测试会把当天的额度用光,影响当天其他测试。这也是为什么它拖了一个多月才做。