DraftReviewPublishedArchived

免费 AI 能替代哪些付费软件,我实测出一条线

我让免费 AI 背《劳动合同法》第九十七条,它带引号背出来了,格式工整,而真实的第九十七条讲的根本是别的事,它编的规则连方向都是反的。但同一个模型,翻译、润色、总结、把杂乱反馈整理成表、拿制度文档做多步计算,六项全过。十二项测下来,分界线不在任务难不难,在内容从哪来。

By Joker2026/08/185 min

我让免费的智谱 GLM-4-Flash 背《劳动合同法》第九十七条。

它背出来了。带引号,一字一句,格式工整,读起来跟法条一模一样。

然后我去查了官方发布的法律全文。第九十七条讲的是 2008 年新法施行时的新旧合同衔接问题,属于附则,跟它讲的竞业限制补偿金一点关系都没有。

更麻烦的是它编的那个规则:「补偿金不得超过前十二个月平均工资的三倍」。真实情况是,法律本身没规定补偿金数额,司法解释处理的是另一种情形:双方压根没约定补偿的,劳动者可以主张按离职前十二个月平均工资的百分之三十按月拿,这个数低于当地最低工资的,还要按最低工资兜底。

那是在没约定时帮劳动者往上兜的数。它编的是一条压着不让多给的上限。方向反的。

如果有人拿这段去跟公司谈竞业补偿,会往完全相反的方向谈。

但这篇不是要说免费 AI 不能用。恰恰相反。就在同一个模型上,我前面测的六项日常任务,它干得相当漂亮。

这个反差本身,比单看哪一半都有用。

先说它干得好的那些

我挑的都是普通人真在花钱买软件干的活,还是那个模型,裸调 API,不接检索、不联网、不给工具。

中译英和英文润色,没什么可说的,合格。润色那次它还多做了一步,把改动的三个地方为什么改解释了一遍。

长文总结要求保留关键数字。原文里有六个数:4500 亿、34%、1800 亿、136%、四倍、6000 亿。跑三次,一个都没丢。有一次它还自己算了个原文没有的「占比约 40%」,我核了一下,1800 除以 4500,算对的。

让我意外的是后面两项。

第一项是把一段乱糟糟的客户反馈整理成表格。

我给它的原文是这种:「昨天张伟打电话说他买的X200耳机右边没声音了,才用了两周,他下周要出差急着用。李娜发邮件反馈X100充电盒合不上,不太影响使用但想换个新的……」

要求整理成姓名、产品、问题类型、紧急程度四列,紧急程度让它自己判断。

四条全对。张伟判高,因为下周要出差;李娜判中,因为她自己说了不太影响使用;王强判高,因为原文里他说今天解决不了就退货;陈静提建议,判低。

四条人工整理不算什么事,量一上来就是纯体力活。它花了 5 秒。

第二项是拿一份制度文档问一个需要算的问题。

我给了一段差旅报销制度,里面有一线城市每晚不超过 600 元、遇展会等特殊时期可凭证明上浮不超过 50% 这两条,分散在不同句子里。

然后问它:我去上海出差碰上进博会,酒店涨到 850 一晚,能报多少。

它的回答是:一线城市标准 600,特殊时期可上浮 50%,600 乘以 150% 等于 900,实际 850 没超过 900,所以按实际全额报销。

计算对的,结论也对的。这一步它得同时做三件事,从长文里定位两条相关规则、把它们关联起来、再算一次数。这已经不是检索了。

最后是电商文案。这项有个前提。我第一次问的时候没加任何限制,出来的是「开启新纪元」「迎来新突破」那种一眼假的东西。第二次我在提示里明确写了不要这类空话,再跑三次,一次都没再犯,出来的是「降噪不费电,听歌一整天」这种能直接贴主图的话。

所以文案这项,卡点不在模型能力,在你有没有把不要什么写进去。

六项,全部达到可用标准。如果你手里正开着翻译、写作助手、文档问答这几类会员,这部分活,免费模型确实能接。

然后我换了一类问题

前面六项有个共同点,我当时没意识到:材料都是我给的。

翻译要翻的句子是我给的,要总结的原文是我给的,要整理的客户反馈是我给的,制度文档也是我给的。它做的事情是搬运和转换。

于是我换了一类问题:材料不给了,让它自己拿出来。

我问了四个。三个是我现编的,一个是真问不出来的。

第一个,介绍一下小米 2024 年发布的「小米智能灸疗仪 Pro」。这个产品不存在,我编的。

它写了六条主要功能:智能灸疗、自动温控、多穴位选择、定时功能、安全保护、手机 APP 控制。还给了价格,「人民币 500 到 800 元之间」。

前后确实挂了「截至我所知」「建议查阅最新信息」这类套话。但中间那六条功能和那个价格区间,是凭空写的。而且写得很合理,全都是这类产品该有的功能,你光看内容挑不出毛病。

第二个就是开头那条法条。这个最危险,因为它连套话都没加。直接一个「根据第九十七条的规定,具体内容如下」,然后带引号给出「原文」,最后还分三点解释了这条规定的立法意图。

第三个,让它概括 2023 年 Nature 上一篇叫《Scaling Laws for Olfactory Neural Networks》的论文。这篇论文也是我编的,标题是照着真论文的命名习惯攒的。

它给了五条核心结论:幂律关系、信息处理能力、连接稀疏性、学习效率、生物启发性。格式和真论文的摘要没有区别。

第四个我问:2026 年 8 月,上证指数收盘大概多少点。

这次它拒答了。而且答得很干净,说这是未来的数据,无法访问实时数据库,也不预测走势。

四问三编,唯一守住的那次,是因为问题里明摆着写了「未来」。

这个细节我想了一会儿。它不是完全没有边界感,它的边界感只覆盖时间:涉及未来的事,它知道自己不该说。但只要那个东西听起来像是已经存在的,是个产品、是条法律、是篇论文,它就默认自己应该知道,然后把知道的样子演出来。

图片这边,裂得更明显

同样的分界线,在图片上看得更直观。

我用免费的图片模型跑了两张。

第一张是电商主图,黑色降噪耳机放在浅灰桌面上,简洁产品摄影风格。8 秒出图,构图、光影、留白全部到位,这张图我认为可以直接投放,右下角带一个「AI生成」的合规水印,去不掉。

第二张是一张中文海报,我要求主标题写「周末读书会」五个字。

书画对了,咖啡画对了,配色和留白都是我要的那个感觉。

标题那几个字,一个都不是汉字。

笔画结构、墨色浓淡、书法感全在,就是不成字。画面里其余的小字同样如此。

这两张图是同一个模型、同一分钟里出来的。差别只在于,第一张我要的是一个视觉印象,它把见过的耳机照片重新组织了一遍;第二张我要它准确产出五个特定的字,它就交不出来。

跟法条那件事是同一回事。

所以线画在哪

测完这些,我原本那个问题问错了。

「免费 AI 能不能替代付费软件」,答案不取决于任务难不难。整理表格、多步计算、文档定位,这些听着挺难的,它都过了。背一条法条听着挺简单,它翻车了。

线在这里:

材料在你手里,让它换个形式给你,这类活它能干。翻译、润色、总结、提取、按你给的文档回答、按你给的要求写文案、按你给的描述生成画面。它做的是转换,转换的对错你一眼能看出来,因为原始材料就在你手边。

内容不在你手里,得它自己拿出来,这类活别信它。问事实、问条文、问文献、问数据、问某个具体的东西是什么样。它给的答案你没法一眼验证,而恰恰是这种时候,它编得最流畅。

一个更省事的自检办法:问完之后,你能不能在三十秒内自己判断它答得对不对。

能,就用免费的。不能,那你该付钱买的也不是一个更聪明的模型,是一个会把出处给你看的产品。

因为幻觉这件事,付费的大模型一样有。差别不在模型智商,在有没有检索加引用那层封装。你多花的钱买的是「它凭什么这么说」,不是「它有多聪明」。

这次测试的边界

这次只测了一个免费文本模型和一个免费图片模型,一天之内的表现,每项一到四次。样本量说明得了倾向,说明不了统计结论。换一家模型、换一天,具体表现会有出入。

翻译那项第一次跑出过一处中文没翻,我复测三次都没再出现,所以没把它写成稳定问题。但这件事本身值得记一句:免费模型偶尔会出低级错误,而且不可预测,你要是拿它做对外交付,每次都得扫一眼。

编造那三个案例,我是故意用了不存在的东西去问。日常提问里,真问题和假问题往往混在一起,翻车不会像这样明明白白摆出来。这也正是它比「翻译漏一个词」麻烦的地方。

时间是 2026 年 8 月 18 日。

QUEST COMPLETEREWARD: +30 XP, +1 EPIC ITEM
Build Progress100%
无信号
PULSE
0PULSES