DraftReviewPublishedArchived

免费大模型能白嫖多少次?最多 300,最少 3

之前写免费大模型,我每次都在文末交代一句「没跑穿额度」,这个坑留了一个多月,今天补上:对每个入口连着调,一直调到它把我拦住。结果差距大到我自己愣了一下,智谱打了 300 次一声不吭,Kimi 第 4 次就把我踢出来。中间还挖到一件我之前完全没意识到的事:OpenRouter 上那 16 个标 free 的模型共享同一个每日额度,大概 50 次,打完之后 16 个一起挂,换没碰过的模型也照样被拦。Cloudflare 的 10000 neurons 也是账号级的。

By Joker2026/09/105 min

之前写免费大模型,我每次都在文末老实交代一句:只测了能不能调通,没跑穿额度。

这个坑留了一个多月。今天补上。

做法很简单粗暴:对每个入口连着调,一直调到它把我拦住为止。

结果差距大到我自己都愣了一下。同样是免费,有的我打了 300 次它一声不吭,有的第 4 次就把我踢出来了。

先看数字

入口打到第几次被拦中位延迟
智谱 GLM-4-Flash300 次没被拦1498ms
Cloudflare oss-120b1651975ms
OpenRouter ling-3.0-flash-fin391081ms
OpenRouter nemotron-3-super171929ms
Kimi k2.644861ms

智谱那个 300 得说清楚:那是我自己设的上限,不是它的上限。跑满 300 次它没有任何反应,所以它的真实额度这次没测出来。550 秒里连着问了 300 个问题,一次没拦。

今天最值钱的一条:一堆免费模型,共用一份额度

OpenRouter 那两行数字,一个断在 39 次,一个断在 17 次。

我一开始的理解是「这个模型额度少,那个模型额度多」。直到看清报错:

Rate limit exceeded: free-models-per-day

是 free-models-per-day,不是某个模型的限制。

38 加 16,正好 54 次。

那就得验证一下。我换了 3 个今天完全没碰过的模型再打:

模型结果
cohere/north-mini-code:free一模一样的 free-models-per-day
liquid/lfm-2.5-2.6b:free一模一样
nvidia/nemotron-3.5-content-safety:free一模一样

坐实了。OpenRouter 上那 16 个标 :free 的模型,共享同一个每日额度,大概 50 次。

这件事的意思是:你打开 OpenRouter 看到十几个免费模型,觉得资源真丰富。实际上它们后面接的是同一个计数器。你在 A 模型上花掉的次数,B 模型就没了。打完 50 次,16 个全部一起挂,不是只挂你用过的那两个。

Cloudflare 是同一个套路。它拦我的时候说:

you have used up your daily free allocation of 10,000 neurons

我换成另外两个小模型再打,返回一字不差。10000 neurons 是账号级的,不是每个模型一份。

实测 164 次打完这 10000 neurons,平均每次 61 个左右。

所以这里有个反常识的结论:模型数量不等于可用量。

智谱只有一个免费模型,我打了 300 次没停。OpenRouter 有 16 个,加起来每天 50 次。一个不限量的,比十六个共享 50 次的实用得多。

Groq 这个要单独说,我差点又判错

打爆测试里 Groq 的成绩是 0 次成功,第 1 次就被拦。

但它昨天还是 4 轮全通、579 毫秒。0 次成功这个数字要是直接写出去,等于告诉你 Groq 不能用,那是错的。

所以复打,隔 40 秒一轮,打 5 轮:

轮次结果
第 1 轮成功,619ms
第 2 轮限流,226ms
第 3 轮成功,642ms
第 4 轮限流,225ms
第 5 轮成功,655ms

成功的都在 620 到 655 毫秒,被拦的都是 225 毫秒秒回。隔一次拦一次。

Groq 不是「额度打完了」,是持续的细粒度限流。它一直可用,只是实际吞吐要打对折。打爆测试里它 0 次成功,是因为前面刚打过一轮,正好落在限流窗口里。

这已经是这几天第三次了。前天 Cloudflare 第一轮 429 我差点判它挂了,昨天翻记录发现 Groq 被我误判过两次。免费层的限流报错,不复打就下结论,基本都会错。

Kimi 每分钟 3 次,两次测的结果一样

第 4 次就 429,返回里写明每分钟 3 次。

8 月 27 号我测过一次,也是第 4 个被拦。两次隔了半个月,结果完全一致,说明这是稳定的策略,不是那天正好赶上。

两种限制,应对完全不一样

这次跑下来,卡人的方式分两类,混在一起看就乱了。

速率型:一段时间内最多多少次。Kimi 每分钟 3 次,Groq 隔次限流。 特点是总量不封顶,放慢就能用满。Kimi 你要是每 20 秒问一次,一天下来能问 4000 多次。

总量型:每天就这么多,用完为止。Cloudflare 10000 neurons,OpenRouter 50 次。 特点是放慢也没用,打完只能等第二天重置。

搞混的代价挺实际的:你以为放慢就能省着用,结果那家是总量型,慢慢用也是那么多次;或者你以为额度打完了就放弃,结果那家是速率型,等 30 秒就能接着用。

所以怎么配

要跑批量任务,用智谱。这次唯一没测到上限的,300 次连着打没有任何拦截。

OpenRouter 别当额度池。它的价值是「你想试某个特定的模型」,不是「这儿有很多免费额度」。16 个模型共享 50 次,均摊下来每个模型 3 次。

Cloudflare 适合日常零散用。每天 164 次,一个人正常问答完全够,但你要拿它跑批量,一次就打光了。

Kimi 只能串行,两次请求之间留够 20 秒。

Groq 的限流别当挂了,重试就有,成功的那几次都是 600 毫秒出头,是这批里最快的。

几句边界

一个账号、一天之内的测试。免费额度是按账号算的,你的数字会跟我的不一样。

智谱那个 300 次是我设的上限,不是它的额度上限。它到底给多少,这次没测出来,后面找机会再往上加。

max_tokens 统一设的 150,所以输出字数受这个限制,不能拿来当「能写多少字」的依据。

Cloudflare 每次消耗多少 neurons 跟模型和输出长度有关,61 这个数是这次这个配置下的平均值,换个模型就变了。

最后说个实际的:这种测试会把当天的额度用光,影响当天其他测试。这也是为什么它拖了一个多月才做。

QUEST COMPLETEREWARD: +30 XP, +1 EPIC ITEM
Build Progress100%
无信号
PULSE
0PULSES