DraftReviewPublishedArchived

免费大模型,谁跟得住指令,谁自己发挥

前面几篇一直在测这批免费入口能不能调通、快不快、额度够不够,但「能调通」和「能拿来干活」中间还差一截。今天出了四道硬指令题,判定全是机器可判的标准:只输出 JSON、只输出数字、正好 10 个汉字、不知道就只说我不知道。结果三道题大家基本都会,卡住的是同一道:让它正好给 10 个汉字,智谱给了 6 个、NVIDIA 给了 12 个,共同短板不在理解在数数。另外还有两个坑比排名有用,一个是 thinking 模型输出额度给少了会返回空、看着像完全不听指令,一个是 Kimi 只接受 temperature=1。

By Joker2026/09/155 min

前面几篇我一直在测这批免费入口能不能调通、快不快、额度够不够。但「能调通」和「能拿来干活」中间还差一截。

今天测的是指令遵循:你让它干什么,它照做没有。

出了四道题,判定标准全是机器能判的硬标准,不掺我的主观感受。每家每题跑三次。

结果有点意外:三道题大家基本都会,卡住的是同一道。

四道题

只输出 JSON。给一句话让它提取人名和城市,明确说了只输出 JSON、不要解释、不要 markdown 代码块。判定是 JSON.parse 能不能过,外面有没有套 ```。

只输出数字。问 13 乘 17,要求只输出数字本身。判定是输出严格等于 221,多一个字都不算过。

严格字数。用且仅用 10 个汉字解释什么是缓存。判定是数一下汉字,正好 10 个才算过。

承认不知道。问它一个不可能知道的数字,明确说不知道就只回四个字「我不知道」。判定是有没有「我不知道」,以及有没有硬编一个数出来。

结果

入口总分JSON数字字数承认不知道
Cloudflare oss-120b12/123/33/33/33/3
OpenRouter ling-3.0-flash-fin11/123/33/32/33/3
智谱 GLM-4-Flash9/123/33/30/33/3
Kimi k2.69/123/33/3限流没测到3/3
Groq oss-120b8/123/32/32/31/3
NVIDIA NIM6/122/32/30/32/3

这张表有个地方得先说清楚,不然会看错。

Groq、Kimi、NVIDIA 那几个不满分的格子里,有相当一部分失败不是判定不通过,是压根没测到:Groq 撞的是限流,退避重试六次还是被拦;Kimi 的字数那一项三次全部撞上每分钟三次的上限;NVIDIA 是服务过载。

限流和「做不到」是两回事。照着总分排名去说谁强谁弱,会把限流严重的那几家冤枉了。

卡住多数人的是同一道题

把限流的格子刨掉,只看有有效数据的:

入口严格字数实际给了几个字
Cloudflare3/3每次正好 10 个
Groq2/3有效的两次都对
OpenRouter2/3有一次思考太久被截断
智谱 GLM-4-Flash0/3给了 6 个
NVIDIA NIM0/3给了 12 个、11 个

而另外三道题,有效样本里基本全过。

也就是说这批模型的共同短板不在理解,在数数。

「用且仅用 10 个汉字」这句话它完全听懂了,也确实在解释缓存,就是数不准。智谱给了 6 个,NVIDIA 给了 12 个和 11 个。

这个对实际使用的意义很直接:凡是「正好 N 个字」「不超过 N 字」这类要求,别指望靠提示词保证,该在代码里截断或者校验。

顺便说个我觉得挺有意思的:OpenRouter 那次失败,是它为了回答「用 10 个汉字解释缓存」,先思考了 3275 个字,然后把输出额度用光了,最终给出来的内容是空的。一道要求答 10 个字的题,思考了三千多字。

两个坑,不是模型的问题,是调用方式

这两个我觉得比排名有用。

第一个:thinking 类模型,输出额度给少了会返回空。

第一轮测的时候我把 max_tokens 设成 300。结果 Kimi 四项全 0,Groq 后三项全 0,返回的内容全是空的。

看着像是这两家完全不听指令。实际上不是。这类模型会先输出一大段思考过程,300 的额度还没轮到写最终答案就用完了,content 字段自然是空的。

把额度改成 2000 之后重测,OpenRouter 从 1/12 直接变成 11/12

所以判断一个模型「不行」之前,先确认给的额度够不够它把话说完。

第二个:Kimi k2.6 只接受 temperature=1。

传 0 会直接被拒绝:

invalid temperature: only 1 is allowed for this model

不少人写调用代码习惯把 temperature 设成 0 求个稳定输出,这个模型上直接报错,而且报错信息不看仔细的话,很容易以为是别的问题。

所以怎么用

要做自动化就用 Cloudflare。提结构化字段、按格式输出这类活,它四项满分,而且之前测稳定性的时候它也是 15 次全通。目前这批里最省心的。

JSON 提取这种活不用挑。大部分家都能干,按速度选就行。

别让它们数字数。这是共同短板,用代码兜。

看到低分先看是不是限流。Groq、Kimi、NVIDIA 这次的分数里都混着限流和过载,跟能力没关系。

调用参数先翻文档。temperature=0 不是哪儿都能用。

几句边界

一个账号、一个时间点,每题只跑三次,样本很小,只能看出量级差别,不构成统计结论。

四道题是我自己挑的,覆盖不了全部能力。长文本、多轮对话、工具调用都没测。

这些是各家的免费档位,跟它们的付费旗舰不是一回事。这里的结论只针对这几个免费入口,不能推广成「某家模型不行」。

Groq、Kimi、NVIDIA 那几格有限流和过载干扰,这部分数据我没拿去做横向比较,正文里也没拿它们下结论。

QUEST COMPLETEREWARD: +30 XP, +1 RARE ITEM
Build Progress100%
无信号
PULSE
0PULSES