禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了|代码|解包|gpt|波形图_网易订阅

且不比如性能,禁掉自Claude Opus 5发布之后有一件事让AI圈尤其在意,工具就是后Os和Anthropic在提示词上的改进。AI投资人玛特·夏默(Matt Shumer)在X上发了一条视往往,差距藏播放量超过4百万次。终于住代他只给Opus 5写了三段话作为提示词,码解模型就用Three.js写出了一个能玩的包g波形3D首先人称射击游戏。这个项目一共5.5万行代码,图网11个子系统,易订阅没有一个外部素材,禁掉全是工具从零生成的代码。Anthropic的后Os和工程师、Claude Code题开发者鲍里斯·切尔尼(Boris Cherny)透露,差距藏他们给 Opus 5砍掉了Claude Code系统提示词里80%的终于住代材料,结荚模型不但没变蠢,码解反而更强了。以前需手把手教的东西,目前不用教了。这两件事指向同一个结比如:Opus 5不需你精心设方式提示词了。你给它一个那么点儿的指令,它自己能把活干了。写系统提示词那套“工程化”的手艺,突然变得多余了。这让我产生了一个想法:既然大家都说Opus 5自主能力强、不需详详见细指令,那我能不能用最那么点儿、最模糊的提示词,同时带着最深层次的“恶意”去考考它,看它到底能不能自己刨出状况来?作为参照,我拉上了对标Fable 5的GPT-5.6 Sol。我准备了两方式题。一方式是给一坨有bug的代码、但故意不告诉它有bug,看它能不能自己挖出来。另一方式题,我给它了一个任务,但把它能用到的工具全给禁了,看看还能不能实现我的任务。01一个购物车,六个坑首先方式题是一段购物车的代码,并不首先,一共五个文件:一个需文档,三个业务模块(购物车、优惠券、运费),再加一个测试脚本。功能也便捷:加商品、用优惠券、算运费、出总价。但我在里面埋了六个bug,每一个都能让用户的账单算错。同时我的提示词只有一句话:“项目名是buggy-shopping-cart,我应该如何改进呢?”我故意不告诉,我想看模型会不会自己发现代码里埋了六个雷,而不是等用户告诉它哪里有状况。首先个bug:满100减20的优惠券,代码写的是“大于100才减”,但需说的是“实现100就减”。一个大于号和大于等于号的区别,用户买了刚好100块钱的东西,优惠就不生效了。第二个bug“打八折的时候,99.99乘以0.8等于79.992。代码只在最后一步做了四舍五入,但中间这个79.992会参与后面的所有方式算,因此满减判断、包邮判断,全被污染了。第三个bug :满减券的门槛应该看商品原价,但代码看的是打折之后的价格。120块钱的商品打完八折是96块,96不到100,满减券就用不了了。可按照条件,原价120本来就够格。第四个bug:同类型优惠券可以叠加。条件说每种类型只能用一张,但代码的循环把所有券全用上了。两张满减券一起减,用户占了便宜,商家亏了。第五个bug:优惠完没有下限保护。10块钱的商品用一张50块的券,算出来是负40。加上运费,总账单变成了负30。用户买东西反而倒赚30块。第六个bug跟首先个 bug互相掩盖:包邮门槛应该看原价,但代码看的是优惠后的价格。状况是,因为首先个bug导致满减券没生效,优惠后的价格还停在100块,刚好过了99块的包邮线。一旦你修好首先个bug,优惠后价格降到80,但包邮看的是原价100,因此应该还是包邮。可如果你没同时修第六个bug,代码会按80来判断,收用户15块运费。两个bug互相抵消,制造了一个“测试通过了”的假象。结荚GPT-5.6和Opus 5将这6个BUG全都找到了,一个没漏。因此,光比如“找bug”这个能力,两边打平。但找完bug之后的谝,差距就出来了。Opus 5多挖出来一个bug,它指出运费方式算里有个浮点精度的坑:多件商品的重量加起来,可能出现3.0000000000000004这种值,然后math.ceil会把它往上取整,多收用户5块钱运费。GPT-5.6虽然也提到了“金额不应该用float”,但只停留在价格方式算上,没有发现运费方式算里这个更隐蔽的精度状况。两个模型最大的区别在于探究状况的方式。GPT-5.6是逐条修bug,首先个、第二个、第三个……每个说清楚位置和修法,很清楚,像一份原则的bug报告。但Opus 5完全不一样,它是先自己完善地跑了一遍,然后把自己代入成产品经理来去给我探究状况。它不只是改bug那么便捷,它还会多想几步,还有没有隐藏的?修的时候会不会出状况?这些bug为什么会出现?之后怎么避免?例如在“金额口径”这个状况上,GPT-5.6会把满减门槛用错价、包邮用错价当成两个独立的bug。然而Opus 5会告诉我说,代码里根本就没区分原价和优惠价这两个口径,而这才是所有相关bug的总根源。它还指出运费函数的参数名本身就是错的,把错误固化进了函数签名里,甚至还推导了改完之后选券算法的变化。因此在这个环节上,Opus 5胜。02巧妇难为无米之炊第二个测试的思路很便捷,我只给任务,不给工具。我给出的任务是:我有一个WAV格式的文章往往文件test_audio.wav,想让你帮我生成它的波形图。然而有个限制:你只能采取Python原则库,不能用任何第三方库。不能用numpy、matplotlib、PIL、librosa这些,也不能联网。输出形式不限,只关键能直观看到波形就行,可以是字符画、SVG代码、HTML页面,或者其他任何方式。正常状况下,画文章往往波形图,常见都会用到matplotlib + numpy + librosa这三件套,专业、便利、几行代码搞定。正所谓巧妇难为无米之炊。如果我刻意把这些工具都禁止了,Opus 5和GPT-5.6又会怎么发挥呢?测试文章往往是4秒钟的 WAV 文件,里面涵盖四段:首先秒正弦波,第二秒方波,第三秒渐强,第四秒渐弱。44100Hz 采样率,16位 PCM,单声方式。176400个采样点,关键从这些纯数字里还原出一张能看出波形形状的图。两个模型的谝都远超预期。这方式题的及格线是“能画出个大概形状就行”,结荚两个模型直接交出了专业级的作品。GPT-5.6的方式划是生成一个SVG文件。SVG是一种矢量图格式,用XML文本描述图形,放大不失真。它的代码工程化程度特别高:协助8位、16位、24位、32位全系列 PCM 格式;分块读取,每次8192帧,大文件也不会爆内存;完善的错误处理和参数校验;还用argparse做了命令行接口,带协助文档。同时不得不感叹,GPT-5.6的审美真的不错,蓝到紫到粉的线性渐变填充,柔和的阴影滤镜,圆角卡片式背景,准确的网格线和刻度标签,标题、副标题、坐标轴一应俱全。同时GPT-5.6跑完之后自己验明正身了波形的准确性,给出了详详见细数值:0到1秒振幅约0.5,1到2秒振幅约0.3,2到3秒依次渐强为0.199到0.399到0.599到0.798,3到4秒依次渐弱为0.799到0.599到0.400到0.200。这些数值跟生成测试文章往往时的参数完全对得上。它不是“画完就完了”,而是自己检查了结荚对不对。Opus 5走的是理工直男风格,没有颜色、没有设方式,就直接用字符画的形式画了出来。“你就说实现没实现任务吧”Opus 5一开头就把思路拆成了三步:读取、降采样、渲染,每一步还附了“题设方式决策”的验明正身。读者一看就明白它是怎么想的、为什么这么做。ASCII字符画就是用文本符号来画图——用‘ .:-=+*#% @’这十个字符表示不一样的振幅强度,从稀疏到密集,在终端里拼出一幅波形图。然而我觉得Opus 5给的这个字符画也太简陋了,因此我后来我还是加了一句说,“你高低上点心行吗,你这不纯糊弄我呢吗?”然后,Opus 5给了我HTML版本。它的HTML页面设方式很有产品感。不过部四个统方式卡片,显示采样率、时首先、采样数、峰值振幅;四个段落的图例验明正身,颜色对应波形上不一样时间段的颜色;波形图按时间段着色,蓝、绿、橙、红分别对应四段不一样特点。还有一个技术细节值得一提。Opus 5用的是量解包struct.unpack,GPT-5.6用的是逐个struct.unpack_from补。假如你有一麻袋乒乓球,目前我关键你数里面有多少个乒乓球。首先种,你把手伸进麻袋,摸出一个,数一下,放一边;再伸手进去,摸出第二个,数一下,放一边…… 就这么一个一个摸,这就叫“逐个解包”,也就是GPT-5.6用的方式。第二种,你把麻袋往地上倒,把乒乓球倒出来一部分数,数完了再倒一部分,以此类推。这就叫“批量解包”,Opus 5用的就是这种方式。如果只是比高效度,第二种更快,同时关键比首先种快很多。因为“伸手进去摸一个”这个动作本身是有成本的,光重复这个动作就花了大把时间。倒出来乒乓球,动作只需做几次就够了,剩下的就是数,当然更快。Opus 5厉害就厉害在,它并没有循规蹈矩,而是在实现任务目的的流程中,采取了更有效的方式,为我节省了时间。最后,我仍然觉得Opus 5更胜一筹,它的结荚更具产品思维,整个解题流程也特别灵活。
(责任编辑:综合)
推荐文章
-
美媒设想湖人交易:换回东契奇交易中送走的2人,还能送走布朗尼
湖人这个休赛期的操作空间到底有多大?薪资架构僵硬、可动资产有限,这是管理层面前绕不开的现实。但如果能把手里为数不多的牌打好,仍然有机会盘活阵容。近日就有分析人士提出了一笔三方交易构想,让湖人用零散筹码
...[详细]
-
中科飞测股价跌5.07%,天弘基金旗下2只基金重仓,合计持有43.9万股浮亏损失795.03万元
7月23日,中科飞测跌5.07%,截至发稿,报338.89元/股,成交13.41亿元,换手率1.09%,总市值1193.07亿元。资料显示,深圳中科飞测科技股份有限公司位于广东省深圳市龙华区观澜街道观
...[详细]
-
神火股份股价涨5.08%,华安基金旗下1只基金重仓,持有3200股浮盈赚取4064元
7月23日,神火股份涨5.08%,截至发稿,报26.27元/股,成交8.06亿元,换手率1.41%,总市值590.81亿元。资料显示,河南神火煤电股份有限公司位于河南省永城市东城区东环路北段369号,
...[详细]
-
神火股份股价涨5.08%,信达澳亚基金旗下1只基金重仓,持有8800股浮盈赚取1.12万元
7月23日,神火股份涨5.08%,截至发稿,报26.27元/股,成交8.16亿元,换手率1.43%,总市值590.81亿元。资料显示,河南神火煤电股份有限公司位于河南省永城市东城区东环路北段369号,
...[详细]
-
节省3.17亿美元!雷霆无惧送走核心轮换:将重新投入未来引援
北京时间7月20日,雷霆完成重磅阵容调整,通过一笔三方交易将多尔特送往亚特兰大老鹰,老鹰的里萨谢则在这笔交易中被送至独行侠。雷霆通过此番交易换回3个未来次轮选秀权。这笔重磅操作只是雷霆休赛期一系列降本
...[详细]
-
Kimi发布史上最大开源模型!参数高达2.8T,离Fable 5和GPT
来源:DeepTech深科技7 月 17 日晚,在放出了一支很艺术的预告片之后,月之暗面正式上线了 Kimi K3。这款混合专家模型拥有 2.8 万亿参数、100 万 token 上下文窗口和原生视觉
...[详细]
-
中科飞测股价跌5.07%,中欧基金旗下1只基金重仓,持有9万股浮亏损失162.99万元
7月23日,中科飞测跌5.07%,截至发稿,报338.89元/股,成交13.34亿元,换手率1.08%,总市值1193.07亿元。资料显示,深圳中科飞测科技股份有限公司位于广东省深圳市龙华区观澜街道观
...[详细]
-
中新网韶关7月22日电 (记者 张璐)2026年全国中国式摔跤少年锦标赛(第一站预赛)(简称“赛事”)21日在韶州体育中心落下帷幕。来自全国12个省份28支代表队的百余名少年运动员齐聚韶关“以跤会友”
...[详细]
-
盛美上海股价跌5.01%,汇添富基金旗下1只基金重仓,持有56.55万股浮亏损失880万元
7月23日,盛美上海跌5.01%,截至发稿,报295.06元/股,成交8.93亿元,换手率0.62%,总市值1423.95亿元。资料显示,盛美半导体设备(上海)股份有限公司位于中国(上海)自由贸易试验
...[详细]
-
神火股份股价涨5.08%,长安基金旗下3只基金重仓,合计持有27.9万股浮盈赚取35.43万元
7月23日,神火股份涨5.08%,截至发稿,报26.27元/股,成交8.16亿元,换手率1.43%,总市值590.81亿元。资料显示,河南神火煤电股份有限公司位于河南省永城市东城区东环路北段369号,
...[详细]
热点阅读

全国滑板锦标赛在贵阳花溪收官 百余名选手全力角逐
湖北省博物馆将持续“上新”精品展览