23 个免费 AI 接口实测,国内直连能用的只有 3 个
半个月前我从机房测过一轮国内直连能调通哪些 AI 接口,但机房出口和家里的宽带完全是两回事,那份结论对家宽用户其实不作数。这次我在家庭宽带上把 23 个接口重测了一遍,全程没开任何特殊网络:海外真能白嫖到结果的只剩 3 个,而这 3 个里连打 15 次只有 Cloudflare 全中。中间还挖到一件事,OpenRouter 那个免费模型的上游就是 NVIDIA,失败信息里写得明明白白,所以把这两家写成互相兜底纯属自我安慰。
半个月前我测过一轮国内直连能调通哪些 AI 接口,那次是从一台机房服务器上跑的。文章发出来之后我自己心里一直有个疙瘩:机房的网络出口和你家里的宽带完全是两回事,路由不一样,IP 段也不一样。我拿机房测出来的结论,对着家里插网线的人说「你也能用」,其实不太负责任。
所以这次我把同一批接口,在家庭宽带上重新测了一遍。全程没开任何特殊网络,就是普通电信宽带,curl 强制绕开本机代理。
一共 23 个接口。能白嫖到结果的,海外只剩 3 个。
而这 3 个里面,只有 1 个我敢拿来干正事。

先说怎么测的,不然数字没意义
很多人测这种东西只做一步:拿 key 调一下,通了就是通了。这样测有个坑,失败的时候你分不清是网络到不了,还是网络到了但人家不接你的单。
所以我分两步。
第一步不带任何 key,直接往接口上打一个空请求。这时候看返回码就能分出三种情况:
返回 401 或者 400,说明网络是通的,人家只是嫌你没带凭证。这种就是能用。
返回 403,说明包到了对方服务器,但被按地区拒了。Cerebras 这种更直接,响应体里明晃晃写着 error code: 1009,这是 Cloudflare 专门用来标记地区封锁的码。
直接超时没响应,那就是网络层压根到不了。
第二步,把网络层通过的再拿真 key 实调一遍,确认真能吐出字来。这一步淘汰掉了一个:SambaNova 网络通得好好的,一调返回 402,让你先绑支付方式。网络能到,但对白嫖党没意义。
国内的 9 个,全通,没有悬念
火山方舟 51 毫秒、智谱 92 毫秒、DeepSeek 95 毫秒、硅基流动 95 毫秒、阿里百炼 121 毫秒、百度千帆 163 毫秒、魔搭 194 毫秒、Kimi 199 毫秒、腾讯混元 1123 毫秒。
这个没什么好说的,本来就在国内。列出来是做个尺子:后面那些海外接口快不快,得跟这排数字比。
腾讯混元 1123 毫秒在国内这批里明显慢一截,我复测了一次还是这个量级,不确定是不是当天的事。
海外能用的 3 个,差距全在稳定性上
Cloudflare、OpenRouter、NVIDIA。这三个网络能通,真 key 也能出结果。
如果我到这儿就停笔,写一篇「这 3 个不用特殊网络也能用」,那这文章就是废的。因为能调通一次,和能拿来干活,完全是两码事。
我给每个接口连着打了 15 次,同一个问题,看多少次能成,延迟散成什么样。

Cloudflare 15 次全中,延迟从 1912 毫秒到 3327 毫秒,两轮的中位数分别是 2488 和 2605 毫秒。这条曲线平得有点无聊,无聊在这里是最高的褒奖。
OpenRouter 15 次成了 12 次,延迟拉得比较开,最快 1985 毫秒,最慢 8852 毫秒。
NVIDIA 15 次成了 11 次,延迟区间是 1136 毫秒到 51632 毫秒。
你没看错,最快 1.1 秒,最慢 51.6 秒,差 45 倍。
差点被骗的地方
NVIDIA 这个我要单独说,因为我自己差点在这儿栽了。
第一次单独调用它,3145 毫秒,挺正常。当时我脑子里已经开始成型一个说法了:上次机房测出来 22 秒,这次家宽 3.1 秒,快了 7 倍,看来家宽路由更好。
听起来很顺,对吧。有对比、有倍数、有解释。
然后我跑了 5 次。中位数 45740 毫秒。
又跑了 10 次。中位数 2312 毫秒。
同一个接口,两轮的中位数差了将近 20 倍。它不是快,也不是慢,它是时好时坏。好的时候一秒出,坏的时候卡到五十多秒然后告诉你 Service temporarily overloaded。
我那个「家宽比机房快 7 倍」的结论要是发出去了,就是一个基于单次采样的错误判断。上次机房测出来的 22 秒,八成也只是撞上了它抽风的时候。
所以看到任何人给你一张 AI 接口的测速表,先问一句测了几次。测一次的数字,跟没测差不多。
一个我没想到的东西
真正让我坐直的是失败信息。
NVIDIA 失败的时候返回 Service temporarily overloaded。
OpenRouter 失败的时候返回的是:Upstream error from Nvidia: Service temporarily overloaded。
我在 OpenRouter 上用的那个免费模型,后缀带 :free 的那个,它的上游就是 NVIDIA 本身。

这件事的意思是:如果你为了保险,在代码里写了「先调 OpenRouter,失败了自动切 NVIDIA」,那你以为自己上了两道保险,实际上是在同一根绳上挂了两次。NVIDIA 一过载,两边同时报错,你的兜底逻辑一点用没有。
这也解释了为什么这两家的成功率这么接近,12 比 15 和 11 比 15,本来就是一回事。
聚合平台的免费模型基本都是这个路子,它自己不养卡,转发到别人那儿去。免费的那一档尤其如此。所以做兜底方案的时候,要看的不是入口有几个,是后面的机器是不是同一批。
被拒的那些,其实分两种
Groq、Cerebras、Anthropic 这三个返回 403。包是送到了的,对方看了眼你从哪来,退回来了。Cerebras 最坦率,直接给 1009。
Mistral、Gemini、OpenAI、xAI、GitHub Models 这五个是纯超时,20 秒没有任何响应。这跟 403 不是一个性质,403 好歹算个回应,超时是连门都没摸到。
对使用者来说结果一样,都用不了。但区分开有个实际好处:403 这类是对方的策略,策略是会变的;超时那类基本没戏。
顺带一提 GitHub Models 上次测是 410 Gone,这次直接超时了。
和机房那次比,变了什么
可达名单一个没变。
上次机房能通的 Cloudflare、OpenRouter、NVIDIA,这次家宽也通。上次被拒的 Groq、Cerebras,这次还是同样的错误码。上次超时的 Mistral、Gemini,这次还是超时。
我本来以为换个出口会有出入,结果两边严丝合缝。这说明这些接口的地区判断是全国一盘棋的策略,不是某个机房的路由问题。反过来说,你在家里试不通的,换个机器八成也一样。
差异只在速度和稳定性上,而这部分主要是平台自己的锅,不是你的网络的锅。
所以怎么选
只想要一个能用的海外免费接口,闭眼选 Cloudflare。15 次全中,延迟区间窄得像条直线。这次测下来它是唯一一个我愿意放进正经流程里的。
OpenRouter 当补充,别当备份。它模型多,这是真优势,但要清楚免费那一档的上游是谁。真要做兜底,得挑一个后端跟你主力不重合的。
NVIDIA 拿来玩可以,别放进任何有时间要求的地方。能一秒出结果,也能卡你五十秒,你没法预测今天是哪种。
手里有国内接口的话,海外这几个的性价比其实不高。智谱中位 1748 毫秒,火山首字节 51 毫秒,稳定性和速度都在海外这几个之上。折腾海外免费额度的主要理由是想用某个国内没有的模型,如果没有这个刚需,绕这一圈图什么。
几句边界
这是一条家庭宽带、一个时间点的快照。不同运营商、不同城市,结果可能有出入,我只有一个出口,没法替你验证你那条线。
每个接口 15 次,这个样本量够看出量级差别,Cloudflare 15 比 15 和 NVIDIA 11 比 15 不是噪声能解释的,但也别把它当成严格的统计结论。
Together 和 Hyperbolic 网络层是通的,我没有这两家的账号,所以没验证实际调用,表里只标了网络可达。
各家的地区策略改得很勤,我这份表的保质期大概以周计。真要用,自己拿 curl 打一下最准,两步法上面写了,照着做就行。