首页/文章/ 详情

GLM-5.3-Flash、Qwen3.8-Flash 同步“登陆”超算互联网!

45分钟前浏览1

8月26日晚,阿里与智谱先后开源新一代多模态模型,GLM‑5.3‑Flash、Qwen3.8‑Flash 凭借高效架构与极强性价比,将国产原生多模态带入极致成本的商业普惠新阶段,让人人都能以低成本调用前沿智能。


超算互联网即刻上线 GLM‑5.3‑Flash 与 Qwen3.8‑Flash 模型 API 服务与权重文件!


模型 API 调用服务

https://www.scnet.cn/ui/console/index.html#/llm/models


用户可登录国家超算互联网官网(scnet.cn)PC 端,通过首页「服务」下拉菜单进入「模型服务」专区,选择「模型 API」服务,即可直达模型 API 调用页面。


开发者无需繁琐环境配置,即可在超算互联网一键调用 GLM‑5.3‑Flash 和 Qwen3.8‑Flash 模型 API 服务,快速将模型能力集成至自有应用与业务系统。


依托超算互联网核心节点部署的全国首个十万卡级超智融合算力资源池,平台提供的“国产算力+开源大模型”一体化交付模式,以及安全可信的 Notebook 开发环境,企业及开发者可根据任务需求,在 AI 社区选择下载 GLM‑5.3‑Flash、Qwen3.8‑Flash 模型文件,进行微调、推理、二次开发。


智谱 GLM-5.3-Flash

前沿智能进入普惠时代


智谱上线并开源 GLM-5.3-Flash (320B-A18B),这是 GLM-5 系列的首个原生多模态模型。超算互联网同步上线 GLM-5.3-Flash 模型 API 服务及模型权重,企业、研究机构可直接调用 API 服务,以及下载模型文件,进行快速部署和开发。



GLM-5.3-Flash 模型地址https://www.scnet.cn/ui/aihub/models/sugon_scnet/GLM-5.3-Flash


GLM-5.3-Flash 总参数 320B,能力超过 GLM-5.2,在全球权威的 Artificial Analysis Intelligence Index(AA综合智能指数)中取得 57 分,进入全球前沿模型能力区间,与 Anthropic 最受欢迎的模型 Claude Opus 4.8 得分持平。在自研 Z.ai Code Bench 体感评估中,其编程表现与 Claude Opus 4.8 相当。



GLM-5.3-Flash 在各项基准测试和实际使用中,全面超越参数量高出一倍的 GLM-5.2,定价却仅为后者的 1/10。这得益于其全新模型架构。GLM-5.3-Flash 的架构专为极低成本而设计,总参数量与 GLM-4.5 相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合最新的 30T Token 多模态预训练语料,GLM-5.3-Flash 能够以更少的计算资源实现更强的性能。


GLM-5.3-Flash 同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型 Scaling 能力。


据智谱官方介绍,“首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”


Qwen3.8-Flash

全新架构,更强更稳更划算



8 月 26 日晚,阿里发布并同步开源千问最新模型 Qwen3.8-Flash,该模型采用全新下一代架构,创下模型效率新基准,推理成本大幅下降,每百万 Tokens 输入仅 1元,输出 3元,价格最低至 DeepSeek-V4-Flash 的 1/3。


Qwen3.8-Flash 模型权重及 API 服务现已上线超算互联网。企业与开发者可通过超算互联网调用 API 接口,开发者也可对模型权重开展二次开发、本地部署与技术研究。


值得一提的是,本次开源的 Qwen3.8-Flash-Next 新架构正是全新一代 Qwen4 系列模型的雏形,也就是说,Qwen3.8-Flash 是下一代 Qwen4 的架构的 Preview 版。阿里提前释出结构上的改动,旨在让社区开发者在  Qwen4 完整模型家族发布前率先对其进行检验与适配。


Qwen3.8-Flash-Next 模型地址

https://www.scnet.cn/ui/aihub/models?keyword=Qwen3.8-Flash-Next


据阿里介绍,Qwen3.8-Flash-Next 是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。


Qwen3.8-Flash 围绕以下四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性:

  •  Attention:采用 GDN + QSA Hybrid 架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA) 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。

  •  Residual:引入 Gated Residual(GR),将 Residual Stream 扩展为 4 条分支,并通过动态 Gate 控制信息读写,增强跨层信息传递和训练稳定性。

  •  Embedding:引入N-gram Embedding,利用局部上下文进行查表,以很少的额外计算扩展模型容量;Embedding Table 可以卸载到 Host Memory,并通过异步 Prefetch 与模型计算重叠。

  • Optimization采用 Muon Optimizer,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。


相比于 Qwen3.7-Plus,Qwen3.8-Flash 显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。



目前,超算互联网已汇聚 1800 余款国内外热门开源大模型,陆续接入多款主流国产大模型 API 接口,包括 GLM、Qwen、DeepSeek、Kimi 等系列,深度覆盖代码工程开发、企业日常办公、全媒体内容(视频、图文、音频等)创作、智能问答等全行业多元业务场景。企业和开发者可按需快速接入多款旗舰大模型,全方位降低 AI 技术落地门槛!

来源:SCNet服务
二次开发UG芯片控制
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-09-05
最近编辑:45分钟前
曙光智算
算力链接价值
获赞 9粉丝 4文章 13课程 0
点赞
收藏
作者推荐

即将发布 | AI社区的这项新计划,与你息息相关

近日,超算互联网AI社区迎来焕新升级,智能体与MCP两大工具新阵地迅速成为开发者关注焦点。无论是希望运用这里的MCP工具和知识库提升智能体开发效率,还是想要直接上手优化延展工作与生活,下面的内容都将为你打开新思路。 学以致用 - 宝藏工具速递 智能体篇 hunyuan3D-2.1SCNet评级:S推荐理由:这款高精度3D生成模型,能大幅缩短传统3D内容的制作周期,显著降低成本,是快速实现创意落地的得力工具。 翻译专家Hunyuan-MT-7BSCNet评级:S推荐理由:支持33种语言互译,涵盖中国五种少数民族语言,翻译效果专业流畅,是跨语言沟通和多语种内容处理的可靠选择。 图像编辑神器-精准的文字编辑Qwen-Image-EditSCNet评级:S推荐理由:专为多语言场景下的文本编辑打造,支持中英文本的添加、删除与修改,在原字体样式保持一致性的同时,实现像素级精确渲染。 音乐生成ACE-StepSCNet评级:A推荐理由:融合扩散模型、深度压缩自编码器和轻量级线性变换器,可在短时间内生成高品质音乐作品,生成速度较传统LLM模型提升15倍,创作更高效。 MCP篇 论文检索MCP工具介绍:提供跨数据库的智能文献检索,一站获取相关论文并自动生成摘要,快速锁定关键信息,极大提升文献调研效率。 SCNet服务工具介绍:超算互联网独家MCP合集。支持根据用户及集群条件,快速检索特定的AI任务详细信息;支持实时查询费用、订单与资源情况,精准掌控账户状态。 来源:SCNet服务

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈