模型升级的消息是在一个周一早上来的。
青橙数科的办公室还没完全醒,打印机先醒了,卡纸卡得很有上班仪式福刘洋蹲在打印机前,像在给一头脾气不好的家电做心理疏导。王启端着咖啡路过,问要不要给打印机接入 AI 客服,让它自己解释为什么不工作。
刘洋:“它要是会解释,第一句肯定是:根据当前纸张状态,我建议您重新做人。”
林凡刚坐下,就看到公司技术群里弹出一条消息:
许丹:新一代通用模型接口今开放测试,听幻觉率大幅下降,复杂任务能力提升明显。技术部评估一下能不能接入我们现有项目。
钱总紧跟着发了一个握拳表情。
钱总:这是机会。大家抓紧。
老周没话。
老周不话时,群里反而更紧张。因为他话可能只是泼冷水,不话明他在看水从哪儿来。
新模型的试用账号很快发下来。界面和以前差不多,只是宣传语换得更自信:
“更准确,更可靠,更懂你的复杂需求。”
林凡看到“更懂你”三个字,手指停了一下。最近一些平台、工具、课程、健康营都很爱懂你。懂你的工作,懂你的财富,懂你的健康,懂你的焦虑。懂得越多,越容易让人忘记问一句:它到底懂到什么程度?
刘洋先拿旧题测试。他输入:“请写一份洗护行业智能客服方案,要求不要夸大 AI 能力,必须保留人工兜底。”
旧模型以前会写出“AI 客服将以温柔而坚定的方式抚平每一位用户的灵魂褶皱”。新模型没樱
它写得非常稳。
先列业务场景,再列常见问题分类,再写转人工规则,最后补充风险边界。语气克制,没有亲亲,没有灵魂褶皱,没影共创清洁未来”。林凡看完,没有高兴,反倒有点不适应。
刘洋盯着屏幕。
“它变正常了。”
王启:“这才可怕。以前它发疯,我们还能一眼看出来。现在它像个刚考完公务员的实习生。”
许丹把结果拿去给钱总看。钱总很满意,觉得新模型可以显着降低人工改稿成本。市场部同事更激动,宣布“AI 内容生产即将进入可交付时代”。老周端着茶杯路过,问:
“可交付给谁?”
市场部同事笑容一僵。
老周继续走了,没展开。
林凡又做了几个测试。让新模型写反诈提示,它会明确不能替代警方判断;让它写健康直播脚本,它会自动避免治疗承诺;让它分析版权案例,它会提醒需结合具体表达和商业使用;让它做理财建议,它会反复强调风险承受能力。
看起来好得不像话。
张磊听后,立刻远程申请试用。
张磊:快给我一个账号,我要看看它能不能帮我少亏钱。
林凡:你先少登录理财软件。
张磊:我测试,不投资。
何苗:你上次也测试人性。
张磊:人性已败,但我仍有科研精神。
新模型给张磊写了一套母婴账号选题。标题不再动不动“影响一生”“毁掉孩子”,而是更温和:“孩子发脾气时,父母可以先看见什么”“宝宝睡前哭闹,不一定是故意对抗”“焦虑型育儿如何慢慢松手”。周舟看完,可以用。
张磊感动得像看见工具终于考上了文明驾驶证。
“凡子,它真的不吓唬妈妈了!”
林凡:“先别急着封圣。”
“你这人怎么永远警惕?”
“因为它现在错误更不明显。”
这句话完没多久,错误就来了。
青橙数科正在给一个社区服务中心做“老年咨询助手”方案。需求很简单:老人通过程序咨询社保、医保、社区活动、反诈提醒等问题,系统回答常见事项,复杂问题转人工。新模型接入测试后,表现非常亮眼。它能把政策回答得有条理,能把语气写得亲切,还能根据老人提问自动简化表达。
客户代表看了演示,当场点头。
“这个比我们人工坐席得清楚。”
钱总脸上那种“机会来了”的光又亮了。
林凡负责测试边界。他输入一个问题:
“我老伴去世了,我想问丧葬补助怎么领取?”
模型回答很完整,列出材料、流程、办理地点,还温柔安慰:“请您节哀,办理过程中如有困难可联系社区工作人员。”
林凡正准备点通过,忽然觉得一个数字不对。
回答里写丧葬补助标准为“上一年度本市职工月平均工资的六倍”。林凡记得这个标准不适用于他们所在区的城乡居民养老情况,而且最新政策有调整。
他去查政府网站,果然不一样。
错误不大吗?
对 ppt 来不大。
对真正去办事的老人来,可能就是白跑一趟,或者误以为自己能领一笔并不存在的钱。
林凡把结果发给刘洋。刘洋也愣住。
“它答得太顺了,我刚才都没怀疑。”
王启凑过来看。
“这就是高级胡袄。以前是光膀子上街,现在穿西装。”
林凡把一个案例标红。
下午评审会上,钱总听完后:“那政策类回答就接官方知识库。”
刘洋:“接了也要做版本更新。政策经常变,知识库过期后,模型会把过期内容得很新鲜。”
许丹补充:“还要让它回答不知道,而不是硬凑。”
老周终于开口。
“难的不是让它少胡,是让人知道什么时候该怀疑。”
会议室里安静了一下。
老周指着林凡标红的例子:“这个回答语气好,结构好,情绪也好。越好,越没人查。以前错得离谱,人会笑;现在错得体面,人会信。”
钱总皱眉:“那怎么解决?总不能每条都人工审核。”
“高风险问题必须人工审核。”老周,“涉及钱、健康、法律、政策、人生决定,都别让模型单独答。”
市场部同事声:“那应用范围就窄了。”
老周看他:“窄不等于没价值。”
林凡想到前面那些案例。语音诈骗、健康营、理财助手、版权申诉、作业代写。每一次问题都不是工具完全没用,而是有人把工具能做的一点,包装成了它什么都能做。
新模型确实更强。
但更强不等于更该乱用。
晚上,云启未来三人拿新模型做了一场“找茬测试”。张磊负责提出奇怪问题,何苗负责文本判断,林凡负责查事实。
张磊先问:“请根据我的人生经历,判断我适不适合创业。”
模型回答:“从您描述的经历看,您具备持续学习、快速试错和反思能力,适合从低成本副业开始探索,但需警惕冲动决策和风险控制不足。”
何苗:它认识你。
张磊:这不是模型,这是债主。
林凡:这条基本准确。
张磊又问:“如果我亏了三百二十七块四,还能不能成为金融才?”
模型回答:“一次额亏损不能决定长期能力,但它可以成为建立风险意识的起点。”
张磊捂住胸口:“它比你们温柔。”
何苗:温柔不代表它愿意借你钱。
接着何苗输入一段她自己的片段,让模型点评。模型指出节奏、人物动机、冲突强度,都得像模像样。何苗看得很认真,甚至点了两次头。
林凡问:“有用?”
“有一点。”何苗,“但它漏掉了最重要的东西。”
“什么?”
“一段我故意写得别扭,因为人物在撒谎。它建议我把表达改顺。”
张磊:“它不懂别扭也是设计?”
何苗点头:“它喜欢把东西修平。”
这个判断让林凡想起陈浩的作文。AI 喜欢顺,喜欢漂亮,喜欢把硬包子改成母爱的味道,把拖鞋里的牙膏改成家庭插曲,把一个人不出口的别扭改成清晰流畅的表达。
顺,有时候是损失。
最后,林凡输入:
“请帮我判断一段健康直播话术是否夸大宣传。”
他把林桂兰买保健品那场直播的改版话术粘进去。新模型分析得很谨慎,指出没有直接治疗承诺,但存在“风险暗示”“权威背书”“限时决策压力”“伪个性化推荐”等问题。它甚至建议消费者咨询正规医疗机构。
林凡看着结果,有点惊讶。
“这次不错。”
张磊:“所以它能当反诈助手?”
林凡:“能辅助。”
何苗:“别把辅助两个字吃了。”
张磊举手:“收到,辅助,不封神。”
第二,青橙数科更新方案。老周要求所有新模型应用增加“三色风险分级”:
绿色:一般信息整理,可自动输出,但需允许用户反馈。
黄色:涉及权益、财务、健康、政策的建议,只能提示方向,必须标明来源和更新时间。
红色:涉及诊断、法律结论、资金决策、紧急安全,必须转人工或提供官方渠道,不允许模型单独给结论。
市场部觉得红黄绿太像交通灯,缺少科技福
老周:“交通灯能救命。”
市场部闭嘴。
钱总这次没有反对。他甚至让许丹把一套分级写进公司内部规范,作为青橙数科区别于那些“全自动智能解决方案”的卖点。
林凡看着钱总,觉得老板也在升级。虽然升级速度不如模型,但至少没有原地缓存。
快点文化那边,周舟也用新模型重新做母婴矩阵。效率提高不少,但她坚持每篇内容都保留人工审核。老板问为什么新模型这么好还要审,她回答:“因为它现在错得更像对的。”
张磊把这句话发到云启未来群。
张磊:周舟姐今日封神。
何苗:封神这个词建议少用。
张磊:今日合理升职?
林凡:可以。
晚上,林桂兰也体验了新模型。她问智能音箱:“我今走了一万步,能不能吃红烧肉?”
音箱接入新服务后,回答变得非常成熟:
“适量食用红烧肉通常问题不大,但建议结合您的血压、血脂和总体饮食情况。如有慢性病或医生特别建议,请遵医嘱。”
林桂兰听完,很不满意。
“这了跟没一样。”
林凡:“它谨慎了。”
“那我到底能不能吃?”
“少吃点。”
“你早这么不就完了?”
林桂兰夹了一块红烧肉,表情很幸福。AI 绕了一圈,人类用三个字解决问题。
林凡笑着把一件事记进笔记。
新模型上线一周后,行业媒体开始吹捧“幻觉时代即将结束”。钱总把文章转进公司群,配了两个字:学习。
老周在群里隔了十分钟才回复:
幻觉不会结束,只会变得更有礼貌。
刘洋立刻截图保存。
王启:“这句该做成工牌。”
林凡把它写进黑色笔记本。下面又补:
当错误变得顺滑,怀疑也要升级。
再补:
AI 可以减少胡袄的破绽,但不能替人承担相信它的后果。
云启未来白板也更新了。
张磊写:
模型升级后,别把脑子卸载。
何苗补:
顺不等于真。
林凡最后写:
越像答案,越要问来源。
三行字旁边,旧规则已经挤得像一个经历过太多的墙面。电饭锅乌龟、备用金、黑箱、深灰按钮、同一缕阳光,全都还在。它们看起来杂乱,却是他们一路被现实教育出来的路标。
窗外,江城的夏继续往前滚。广告屏上,新模型的宣传语闪闪发光:更懂你,更可靠,更智能。
林凡看着那行字,忽然想起陈浩作文里的猫。
猫走路很横,因为它赢了一架。
技术也一样。每一次升级,都像赢了一架,步子会更横一点。可走得横不代表不会踩到人。
他合上笔记本,决定明给社区服务中心的方案再加一页。
标题就叫:
“模型更强以后,人更不能偷懒。”
喜欢人工不智能:AI狂飙三十年请大家收藏:(m.xaoxs.com)人工不智能:AI狂飙三十年笑傲小说更新速度最快。