DraftReviewPublishedArchived

13 个免费大模型,一个月挂了 4 个

我服务器上挂着一份 7 月 12 日逐个真调校准过的免费大模型清单,13 个入口。昨天原样重跑,挂了 4 个:GitHub Models 已在 7 月 30 日彻底退役、ModelScope 模型下架、OpenRouter 免费档撤了。活着的 9 个里,最快和最慢差 30 倍。附存活对照表和一个不报错就开始计费的坑。

By Joker2026/08/115 min

我服务器上挂着一份免费大模型清单,13 个入口,7 月 12 日逐个真调校准过——哪家什么额度、每分钟能发几次、慢到什么程度,全是当时一个个试出来的,不是抄的。

昨天我把这份清单原样重跑了一遍。

13 个里,挂了 4 个。

不到一个月。

先说最意外的那个:GitHub 的免费模型,没了

清单里有两个入口走的是 GitHub Models——GPT-4.1 和 GPT-4o-mini。7 月 12 日测的时候,GPT-4.1 大约 50 次/天,4o-mini 大约 150 次/天,是白嫖 OpenAI 系模型少有的正经渠道。

昨天再调,返回这个:

github_models_retirement_brownout:
GitHub Models is temporarily unavailable
as part of a scheduled retirement

查了官方公告,GitHub Models 已经在 2026 年 7 月 30 日彻底退役。playground、模型目录、推理 API、BYOK 全部下线。退役分三步走:6 月 16 日停止新客户,7 月 1 日宣布 7 月 30 日全面关停,中间 7 月 16 日和 7 月 23 日各做过一次 brownout(短时间断服演练,提醒你赶紧迁移)。

关键是最后这一刀没有豁免老用户。哪怕你一直在用、用量正常,7 月 30 日照样断。

我那份清单是 7 月 12 日校准的。十八天后它就死了。

另外三个的死法各不相同

ModelScope 的 DeepSeek-V4-Flash,一个月前还是 2000 次/天,现在报:

400 Model id : deepseek-ai/DeepSeek-V4-Flash,
has no provider supported

不是限流,是这个模型 ID 在平台上已经没有供给方了。模型本身被下架,接口还在。

OpenRouter 的 Llama-3.3-70B free,报的是:

404 This model is unavailable for free.
The paid version is available now

免费版下架,付费版接着卖。这是最典型的一种死法——不是关停,是把免费档撤了。

SambaNovaPAYMENT_METHOD_REQUIRED,要求先绑支付方式。不过它 7 月就死了,清单里当时已经标着「已死」,这次只是确认它还死着。

所以严格算,这一个月里新挂的是四个入口:GitHub 两个、ModelScope 一个、OpenRouter 一个。

活着的九个,快慢差 30 倍

挂掉的说完了,说说还能用的。同一个问题、同样的参数,挨个调一遍:

模型单次耗时并发 5
Cerebras oss-120b576ms5/5
Groq oss-120b671ms5/5
Gemini Flash-Lite1267ms5/5
智谱 GLM-4-Flash1543ms5/5
Mistral Large2668ms4/5
NVIDIA Nemotron-49B4842ms5/5
智谱 GLM-4.7-Flash6290ms返回空
Kimi k2.612284ms5/5
火山 GLM-5.217574ms5/5

最快的 Cerebras 是 576 毫秒,最慢的火山 GLM-5.2 是 17.5 秒。差 30 倍。

这个差距很要命,因为它们在清单里是并排列着的,看上去都叫"免费可用"。但 576 毫秒的那个,用户在页面上等一下就出来了;17.5 秒的那个,任何有人在前面等着的场景都不能用——用户早就以为卡死走人了。它只适合夜里跑批处理。

并发测试里只有 Mistral 挂了一个,五个并发请求有一个吃了 429。这跟它「每分钟 2 次」的限制对得上:它日额度给得很大方(10 亿 token/月),但水龙头开得极小。额度大和能猛薅完全是两回事,这是我见过最多人栽的一个误区。

还有个坑要单独提:智谱 GLM-4.7-Flash 调通了,但 content 是空的。不是模型坏了,是它属于思考模型,max_tokens 是"思考 + 回答"的总预算,思考本身就要吃掉一千多个 token。你给 500,全被思考用光,答案就没预算写了,返回空字符串、finish_reasonlength。给到 1500 以上才稳定有内容。

一个不报错的坑:同样的模型,调用方式不对就从免费变收费

火山 GLM-5.2 这条要单独讲,因为它是这份清单里最容易亏钱的地方。

清单里记着一条铁律:调它必须用「授权接入点」的 EP ID(形如 ep-m-2026...),走这个通道才算协作奖励、才免费。如果你图省事直接用 Model ID glm-5-2-260617 调,后台明示是按 Token 后付费。

同一个模型、同一个 key、同一个接口,只是请求体里 model 字段填的东西不一样,一个不花钱,一个开始计费。

我这次重测走的是 EP ID,所以上面那个 17.5 秒是免费通道的成绩。

这类坑最阴的地方在于它不报错。你照样调得通、照样拿到结果,体验上毫无差别,只是账单在后面等着你。等发现的时候通常已经跑了几万次。

顺带一句,同一家的豆包、DeepSeek、图像模型都是按 Token 付费的,别顺手加进免费池——而且一旦账户欠费,会连带把免费的那个也锁死

额度这一栏,我这次没重测

需要说清楚的边界:这次我重跑的是存活、延迟、并发,没有重测额度——把每家的日额度真正跑穿要消耗大量调用,成本太高。

下面这份额度是 7 月 12 日记录的,现在只能当参考:

模型当时记录的免费额度
火山 GLM-5.2日额度百万级,用尽拒绝、不计费
Mistral Large10 亿 token/月,但 2 次/分
Cerebras oss-120b100 万 token/天,约 30 次/分
Gemini Flash-Lite约 1500 次/天
NVIDIA Nemotron40 次/分,无日上限
Groq oss-120b1000 次/天,但 10 万 token/天封顶
智谱 GLM-4-Flash永久免费不封顶
Kimi k2.6走余额,当时剩不到十块

考虑到一个月里挂了四个入口,这些数字现在有多少还准,我不敢打包票。当参考看,别当依据用。

我自己怎么排

要快、要扛并发,用 Cerebras 或 Groq。半秒到七百毫秒,并发五个全过,这两个是唯一能放在用户面前的。

国内直连不想走代理,用智谱 GLM-4-Flash。1.5 秒,并发全过,永久免费不封顶。它能力一般,但从来不掉链子,我所有链路的最后一道保险丝都是它。

要长上下文、能等,才轮到火山 GLM-5.2。十七秒的响应只能接受离线批处理。

Mistral 单独用要控频,别并发,老老实实排队发。

思考模型记得给足 max_tokens,不然就是白调。

这份清单的保质期,大概就是几周

写到这我其实有点犹豫要不要发。

因为按这个衰减速度——一个月挂四个——这篇文章里的表格,一个月后大概也有几行是错的。我给你一份清单,转头它就开始腐烂,这事本身有点荒诞。

但反过来想,这恰恰是最该说的一件事:网上那些"2026 免费 AI 大模型大全",绝大多数是几个月前抄来的,抄的时候就没验,之后更没人回头重测。你收藏的那份看着有二三十家,实际点开可能一半是死链。GitHub Models 退役这么大的事,到现在还挂在无数篇"免费白嫖指南"里当推荐。

所以比这张表更有用的,是别信任何没标日期的清单,包括这一篇。它的日期是 2026 年 8 月 10 日。

真要用之前,花两分钟自己跑一遍最保险——挨个发一个最简单的请求,看谁还应答。我这次重测全程也就十几分钟。

QUEST COMPLETEREWARD: +30 XP, +1 EPIC ITEM
Build Progress100%
无信号
PULSE
0PULSES