免费大模型 API:谁还能白嫖,谁真能打
2026-07-30 真调:把十几个能免费白嫖的大模型 API 挨个调了一遍,掐秒表记下今天的可用性、速度和坑。谁能打、谁能用但慢、谁今天废了,附白嫖的四个坑。
今天(2026 年 7 月 30 号)我干了件挺无聊但有用的事:把手上十几个能免费白嫖的大模型 API,挨个调了一遍,掐着秒表记下它们此刻的可用性、速度和坑。
免费大模型这东西,政策变得特别快。网上那些「十大免费大模型」榜,大多是几个月前的,照着接你会踩一堆空。所以这篇不讲理论,就给你一份今天的真实况:谁还能白嫖,谁真能打,谁已经废了。免费额度和可用性随时会变,具体以各家官方为准,但方法和坑是通用的。
先把结论摆上来。

第一梯队,又快又免费,适合当主力或者高频调用。Cerebras 的 gpt-oss-120b,今天实测 0.56 秒返回,一天一百万 token 的免费额度,这个速度和量级,拿来做需要频繁调用的活最划算。智谱的 GLM-4-Flash 更狠,0.34 秒,永久免费、不封顶,它不算最聪明,但胜在快、稳、永远在,我一直拿它当整条链最后的兜底保险丝。还有 Groq、NVIDIA、Gemini,都在一秒上下,额度也够日常。
第二梯队,强但慢,适合放到对质量要求高、但调用不频繁的地方。火山的 GLM-5.2,走「协作奖励」的接入点是免费的,日额度很大,但今天实测要 7 秒才返回,还容易读超时,拿它做实时的、用户在旁边等着的活会卡。Mistral Large 一个月十亿 token 的免费额度很香,今天也要 6.8 秒。GitHub 的 GPT-4.1 质量好,可一天只给五十来次,只能留给低频的重活。
然后是今天翻车的几个。ModelScope 的 DeepSeek-V4,我连调两次都是 429,限流了,前阵子它还好好的一天两千次。OpenRouter 那个免费的 Llama,直接 404,模型下架了,它家的免费模型名换得特别勤。还有一批是彻底欠费死掉的:SiliconFlow、阿里百炼、百度千帆、腾讯混元,调过去要么余额零要么 key 失效。有意思的是 SambaNova,上个月我这儿记的是它欠费死了(402),今天再调居然复活了,又能用了。
你看,这就是免费大模型的真实状态:今天能用的明天可能限流,上个月死的这个月可能复活。别信任何一份超过一周的榜。
真跑一圈,几个坑值得单独拎出来说,都是要花过钱或者做过流程验证才知道的。

第一个坑,也是最隐蔽的:火山的免费,有个前提。它的免费额度走的是「协作奖励」,你必须用它给你的那个「授权接入点」(一串 EP 开头的 ID)去调,才被算作免费。如果你图省事直接填模型名去调,它会按 token 收费,一调就扣钱。这个规则藏在后台文档里,第一次接的人十有八九踩。
第二个坑,今天我自己就踩到了。像 gpt-oss 这类会「先思考再回答」的模型,你如果把 max_tokens 设得很小,比如只给十个,它会把这点额度全花在内部思考上,最后返回给你的正文是空的。我第一遍测 Cerebras 就这样,以为它挂了,把 max_tokens 放大到三百再调,正常的回复就出来了。用这类推理模型,token 上限别卡太死。
第三个坑,是心态上的:别把免费当成稳定。前面说了,SambaNova 复活、ModelScope 限流、OpenRouter 换模型,智谱那个 GLM-4.7-Flash 上个月实测要 46 秒、今天只要 0.8 秒,速度像过山车。免费额度是各家拿来拉新的,说砍就砍。所以真拿它做点正经东西,一定要串一条 fallback 链,主力挂了自动换下一个,别把命押在任何一个上。
最后一个坑,是花钱的坑:别把按 token 付费的模型,放进一个会自动、高频调用的池子里。豆包、DeepSeek 官方这些是一调就扣钱的,更麻烦的是一旦账户欠费,它会把你账号下所有模型都锁掉,包括那些本来免费的。免费的池子里,只放真免费的。
真要用免费大模型搭点东西,我的搭配是这样:高频、要快的活,链头放 Cerebras 或者 GLM-4-Flash;要质量、能等的重活,放火山或者 Mistral;最后永远垫一个 GLM-4-Flash 兜底,因为它不封顶、几乎不挂。关键是别只用一个,免费的随时会挂,多串几层,才不至于哪天某家一限流,你整个东西就瘫了。
免费大模型能白嫖,能干不少活,但它给你的是「额度」,别当成「承诺」。当成随时会消失的东西来用,你就不会被它坑到。