文章正文

铁石心肠

Qwen3.8,登顶英伟达榜单!_我的网站

幸福魔方

A |     一年一度的新 iPhone “抽奖”活动,终于还是来了。                   这里说的抽奖,不是那些博主“我们给大家抽一款全新 iPhone!”的抽奖,而是在小红书、贴吧等平台上,有这么一群 iPhone 用户,他们利用苹果的 14 天无理由退换货政策,不断退货、换货,誓要“抽”到一台显示没有色差、没有色偏、字体通透,且必须屏幕产自三星的 iPhone。    智东西(公众号:zhidxcom)     作者 | 程茜     编辑 | 云鹏          智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。

B |          榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。

C |                              当前用在 iPhone 上的三星面板,型号一般是“G9N”“G9P”“G9Q”, LG 的则是“GVC”“GH3”。所以,只为一个“G9N”开头的屏幕面板,他们可以换货 3 次、5 次,甚至 10 次、15 次,和售后磨破嘴皮子、和客服耍足心眼子。         这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。         SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。         7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。                   有人说,这是浪费时间的吹毛求疵;有人说,这是花了万把块买手机该有的完美主义。先不论立场和对错,大家口中的“三星屏”,真有如此优秀,值得着了魔一样地频繁退换机?                    这背后的原因,比一句“吹毛求疵”、“完美主义”复杂得多。

D | 该模型参数2.4T,可能是除了Fable 5外最强大的模型。                   一、退换货的源动力                    手机这样的产品,有时候买到有一点品相瑕疵、功能问题的,退换货一次两次也很正常,但在功能正常的前提下,去退换三五次,甚至十几次,难道真的单纯为了个“三星屏”?                    当然不是。                   目前 iPhone 上三星和 LG 屏幕面板的对比中,普遍认为三星的屏幕颜色更正、大角度不偏色、颜色更通透和字体不发虚。                   在小红书和 B 站上,不少人放出了不同屏幕的显示效果实拍图,确实可以看到,标注为 LG 屏幕的 iPhone,的确在大角度下会更加偏绿一点。昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。                             另一方面,有一些用户反馈的 LG 屏幕字体发虚,特别是白底黑字这样反差最明显的时候;而三星的屏幕字体边缘更加清晰锐利。         一、从124个模型中提取,共235项CUDA内核优化任务          随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。         基于此,英伟达提出了SOL-ExecBench基准套件。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。         与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。                             此外还有用户认为 LG 屏的 iPhone 在屏幕显示纯色(尤其是中低亮度的灰色)时,能看到屏幕亮度不均匀,好像屏幕没擦干净一样,有“脏污”或“条纹”感,会认为 LG 的屏幕都是“抹布屏”,显示颜色或者图片时远没有三星的那么通透。                   现在在小红书、B 站上还能轻松找到一大堆罗列 LG 屏幕面板的“罪状”,甚至还有一些账号搞了个“一等奖苹果手机对照表”,写明哪些手机零配件的供应商是最好的,哪些是差的,全部用上最好零部件供应商的苹果手机才是“一等奖手机”,放大用户的焦虑。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。         英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。                             在这么一通组合拳下,不同零部件供应商组成的 iPhone 实际体验有没有差距先不说,要是真买到了如小红书所言的“一等奖手机”,情绪价值这块啊,被拿捏住了。         具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。

E |                    那“三星屏幕的显示效果远好于 LG”,“一等奖手机”这类说法,是不是真的?                    二、“屏幕抽奖”的真相                    很遗憾,从结论上来看,三星供应的屏幕,的确在大部分情况里要比 LG 的要更好一些。         为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。

F | 此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。         此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。         该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。这个残酷的事实,意味着一部分人买的 iPhone 手机,的确是“二等公民”。         该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。         根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。         二、榜单排名靠前,意味模型具备闭环自我改进潜力          Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:          反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;     标准客观:距离硬件理论极限还有多远,没有歧义;     迭代自然:每一轮优化都可以作为下一轮的起点。         这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。         在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势:          长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。                   首先,最容易被用户感知到的“字体边缘更清晰”,其根本原因在于三星独家的“钻石排列”(Diamond Pixel)专利技术。

G |     工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。这种技术的特点是红蓝共用的 Pentile 布局下,绿色子像素最多并呈椭圆形,红蓝子像素为菱形(钻石状)且尺寸较大。                             这种排列方式是三星的专利,它在“像素填充率”和“抗锯齿”方面做了深度优化。    稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。

H |     系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。其绿色子像素的密度最高,而人眼对绿色最敏感,因此在渲染文字和精细线条时,其有效解析度(Effective PPI)非常高,文字边缘“黑白分明”,观感最锐利。         这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。         三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架          智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。         首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。                   同时为了规避三星的专利,其他厂商必须采用不同的“类钻石排列”方案。

I |                    在 LG 这边,虽然也是红蓝共用的 Pentile 布局,但其子像素的形状和布局与三星不同,绿色子像素更接近圆形。

J |                    最终,尽管在 PPI 相同的情况下,LG 的排列方式在渲染文字边缘时,其子像素的“组合”方式可能不如三星的钻石排列高效。这就可能导致在笔画的边缘出现轻微的“色边”(红或蓝的毛刺)或“虚化”,使人感觉字体“发虚”或不够清晰。         1、研究人员搭建了基于沙盒的真实GPU训练环境:          为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。                             另外,一些用户描述的“三星屏幕更通透”,在技术上对应的是“极佳的屏幕均匀性”(Uniformity),这种通透感的反面,就是俗称的“抹布感”或“阴阳屏”,其学名为 “Mura 效应”。

K |                    Mura 是日语“不均匀”的意思,源于 OLED 在复杂的制造过程中,无法保证数百万个像素点拥有绝对一致的电学特性。这可以确保每一个训练信号都有真实的物理意义。

L |          2、真实Kernel仓库作为训练数据          研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。                   举一个简单的例子:理想中,施加 1.5V 电压,A 像素和 B 像素应该发出完全相同的亮度。但现实中,由于制造公差,施加 1.5V,A 像素可能发出了 10 尼特的亮度,而 B 像素只发出了 9.8 尼特。                   当这种千千万万的微小差异汇集在一起,在显示纯色,尤其是中低亮度灰色时,就会宏观地表现为亮度不均的“脏污”或“斑块”。                   最后,还有“LG 屏偏绿”这件事,实际上并非指屏幕整体色温不准,而是专指在光线极暗的环境下,将屏幕亮度调至最低并显示深灰色内容时,屏幕出现不均匀的绿色。         3、RL基础设施的针对性优化          Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。         为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。         在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。         ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)          在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。                   这就像一个由红、绿、蓝三个灯泡组成的调光灯组。当您试图把亮度调到几乎为零(显示深灰色)时,理想情况是三个灯泡都发出 1% 的微光。                   但由于 OLED 中绿色子像素的“发光效率”最高,在极低电压下,它可能发出了 3% 的亮度,而红色和蓝色灯泡只发出了 1%。                   这件事说白了,就是三星作为 OLED 屏幕的“霸主”,其制造工艺和对 Mura 效应的校准(Demura)技术更为成熟,而 LG 作为追赶者在这两个领域相比三星还有差距。                   因此,消费者“抽”到具有可感知绿屏现象的 LG 屏幕的概率,在统计上就可能高于三星;在用户端体现的,就是 “LG 的屏幕更绿一些”。                   三、被忽视的事实                    不过,相比上面的这些技术分析,很多人都忽略了一个至关重要的变量:苹果的品控策略与大规模量产的现实。         这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。         结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限          Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。                   首先,苹果作为采购方拥有极其严苛的品控标准。         自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。无论是三星、LG 还是京东方,它们交付的任何面板都必须首先满足苹果设定的下限。                   这意味着,上述的理论差异在出厂时就会被严格筛选,在绝大多数情况下,这些不同供应商之间的差异已经非常细微,对于绝大部分普通用户来说,如果没有在专业的暗室环境下进行细致的 A/B 对比测试,这些差异是很难感知到的。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。                   特别是当你只有一台手机、没有参照物的时候,绿一点、清晰一点、通透一点,仅凭肉眼,大多数人是看不出来的。                   其次,“屏幕抽奖”不仅存在于品牌之间,更存在于品牌之内。                   工业品的大规模量产,追求的是在可接受公差范围内的“良品率”,而不是制造“艺术品”。                   以今年 iPhone 17 Pro Max所用的 LG GVC 面板为例,在同一个批次中,就有用户拿到了观感通透、色彩纯正的“完美屏”,甚至说这才是 iPhone 17 Pro Max 这代的“天花板”,同时也有用户报告了虽然抽到了三星屏,但出现了轻微的黄绿偏色或“抹布感”。                             这说明了什么?有时候用户觉得屏幕不够好,不一定是供应商(LG vs 三星)的差异造成的,而仅仅是大规模生产中无法避免的、随机的品控公差造成的。

M |                    退一万步来说,就算三星比 LG 好得多,苹果大概率也会把三星调到和 LG 一样。

N |                    所以,今天我们所热议的“屏幕抽奖”,实际上是微小的技术差异、随机的量产品控公差这两者共同作用下的一个复杂现象。

o |                    四、“抽奖”的喜与悲                    那么,回归到最初的问题:为了追求那块“完美屏”而参与“屏幕抽奖”,到底值不值得?                    从执行消费者权益的角度来看,这似乎无可厚非。无论是苹果官方还是各大电商平台,都提供了“7天无理由退换货”、“14天无理由退换货”的消费保障。                   消费者在规则范围内,通过退换来筛选一台自己最满意的设备,这在情理和法理上都站得住脚。                   甚至于,那些同时购买十几台设备回来逐台挑选再退货的“专业玩家”,也只是在最大化地利用平台规则。

p |                    但是,这种“合理”的行为背后,潜藏着一个容易被忽视的风险:触发风控检测。

q | 说到底,“无理由退货”是一项消费者福利,而非一项可以被无限利用的商业条款。                   同样是坊间传言,根据Reddit、V2EX、酷安等网络社区的大量用户反馈,过于频繁、短时间内连续的退货行为,尤其是非质量问题的退货,确实有概率被苹果官方系统自动标记为“高风险账户”或“滥用退货政策”,不过暂时看来还不清楚会导致什么严重后果。                   相比之下,电商平台的风控就更直接了,过高的退货率会显著影响用户的信用评分,一旦你的账号成了“黑户”,到了要抢购新品时,这个账号就有可能次次都失败。

r |                    一边是“完美机器”的诱惑,一边是账号被黑的风险,各位苹果用户会如何权衡呢?                    本文来自微信公众号:蓝字计划,作者:Hayward。

Current article:http://www.liaoenxingunchuanglou.buzz/bt9/ouxkdl.xls

Published on:08:56:51


|