当前算力行业普遍存在硬件堆砌、资源割裂、利用率低等痛点,科研仿真与AI训练算力体系互不兼容,造成资源闲置、成本浪费,万卡级超大集群运维难、卡顿故障频发等问题尤为突出。针对行业痛点,曙光Gridview 7.0全新升级,以多重核心能力,实现超大算力集群从“规模化建设”向“高效化运营”的转型。在资源调度层面,Gridview 7.0打破算力壁垒,依托自研双引擎架构,打通科研仿真与AI训练算力体系,实现算力资源池化共享、节点无缝切换,可错峰承载不同算力任务,彻底杜绝资源空转浪费。其作业吞吐效率较传统调度器提升近8倍,可稳定支撑上万节点运行,通过调度、查询分流机制,解决万卡集群查询卡顿难题,大幅提升集群运行稳定性。在应用落地层面,平台搭载双智能体系统,大幅降低算力使用门槛。预置材料、量子化学等主流科研软件,无需复杂搭环境、调参操作,用户下达需求即可自动完成任务拆解、部署运算、生成报告,材料研发、基因测序等场景效率提升3倍,后续还将迭代更多领域专用智能体。同时支持智能故障定位,简化运维流程。在算力运营层面,Gridview 7.0搭建六级全链路可观测体系,依托2亿余项监控指标,精准定位芯片到集群的各类故障。平台兼具全栈国产化适配、安全合规能力,支持多种计费模式与跨地域集群统一调度,为十万卡级超大集群提供一站式、可商业化的算力运营解决方案,助力算力行业高质量落地应用。
继续阅读:
星空人工智能技术网 倡导尊重与保护知识产权。如发现本站文章存在版权等问题,烦请30天内提供版权疑问、身份证明、版权证明、联系方式等发邮件至1851688011@qq.com我们将及时沟通与处理。!:首页 > AI電報 » 从管理算力到运营算力,曙光给出落地解法