(原标题:海外神秘大模型“牛来”,原来是智谱的!)
8月26日晚间,“国产大模型第一股”智谱上线并开源GLM-5系列的首个原生多模态模型GLM-5.3-Flash (320B-A18B)。这款大模型是前段时间在海外社区走红的神秘大模型“牛来”。
此前,一款代号为Ox Alpha的匿名新模型在OpenRouter(全球头部大型API聚合平台)和OpenCode(开源AI编程助手平台)上线后迅速在海外走红。
智谱在8月26日表示,此前公司以匿名模型Ox-Alpha(中文社区称作“牛来”)在OpenCode平台和OpenRouter平台上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。
据智谱介绍,GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。简而言之,就是在保持精准长上下文能力的同时,大幅降低长上下文服务成本。同时,其采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling能力,也就是mHC就是给AI的内部学习过程加了一套“智能导航系统”,在同样的参数量下,模型能学到更多有效知识,推理更快、更准。
GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的十分之一。相当于用十分之一的成本,跑出了更强的性能。这得益于其极低成本的全新模型架构,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。
同时,GLM-5.3-Flash在专业工作中的表现相较同级别模型提升。针对PPTX、PDF、DOCX和XLSX等Office与文档类任务,新增的视觉理解能力使模型能够检查并优化自身输出,并具备更强的审美判断。模型还可以将自己的输出结果与视觉上下文以及预期的结果进行对比,从而实现更有效的自我验证和优化,包括更准确的呈现质量评估以及审美判断。
值得一提的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,该公司首次在GLM-5.3-Flash中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。这要求智谱针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。
8月以来,国产旗舰模型接连更新,性能持续提升,调用保持全球领先。兴业证券研报分析,OpenRouter数据显示,8月10日—16日,中国大模型周调用量达36.84万亿Token,环比增长7.56%,连续16周超过美国,稳居全球首位。同时,DeepSeek、MiniMax、智谱、腾讯等国内厂商已将RSI(递归自我改进)纳入技术研究路线中,从战略规划、产品落地、工程工具等多个维度布局,将引领下一代大模型能力升级,驱动国产模型对标全球顶尖水平。
