弔撕 發表於 5 天前

“超級大腦”運轉起來(深度觀察)

           在2026世界人工智能大會暨人工智能全球治理高級別會議上,全國產10萬卡人工智能超集群曙光8000進行展示。
  龍 巍攝(影像中國)
           在世博展覽館,參展商(左)在中科曙光展台前作介紹。
  新華社記者 張笑宇攝
         
  近日,我國首個全國產10萬卡人工智能超集群——曙光8000正式落成投用,並同步接入國家超算互聯網鄭州核心節點。這標志著我國算力基礎設施建設正式邁入10萬卡級部署階段。曙光8000投用首周已實現滿載運行,日均處理作業數突破15萬個,單日處理作業峰值超過50萬個,已完成多項超智融合應用適配,覆蓋大模型訓練、高通量推理、科學計算等多個應用場景。
  在近日舉行的2026世界人工智能大會暨人工智能全球治理高級別會議上,曙光8000被列入本屆大會十大“鎮館之寶”。這台“超級大腦”如何煉成?它將在哪些領域發揮作用?記者進行了採訪。
  將高精度科學計算與低精度智能計算能力統一到同一系統中
  超算和智算都是處理海量數據、支撐前沿科技的算力基礎設施。超算主要立足科學研究,定位於大科學、大工程的問題求解,追求計算精度,如氣象預測、飛行器設計、地震模擬等,都是它的應用領域﹔智算則偏重人工智能算法和模型創新,雖然對精度要求不高,但追求計算性能,支撐大模型訓練與推理、自然語言處理、自動駕駛等人工智能融合應用。
  隨著大模型規模提升、計算場景擴展和智能化應用的深入,亟須能夠應對高並發、高吞吐、多精度和多任務負載的新一代算力基礎設施。
  “人工智能正在從大模型向智能體、具身智能快速演進,需要同時具備支持高精度的科學計算和低精度的人工智能訓練的能力,這就要求計算系統在架構、規模、能效和可靠性上進一步創新。”中國工程院院士李國杰說。
  “面對龐大而異構的算力需求,構建開放、高效、協同的計算生態,成為釋放智能計算價值的關鍵。”中國科學院院士鄂維南表示。
  曙光8000就是在這一背景下研制的。作為超集群,曙光8000將成千上萬張計算加速卡進行高速互聯,在邏輯上將其整合為一台統一調度的“巨型計算機”,從而提供超大規模的並行算力。
  “它採用了‘超智融合’的技術路線,將高精度科學計算與低精度智能計算能力統一到同一系統中。”中科曙光高級副總裁李斌解釋,這意味著,一個芯片、一個計算單元既需要具備對科學工程計算、數字計算仿真的支撐能力,也需要具備對神經網絡類算法的支撐能力。
  曙光8000正是這樣一個面向多場景、多精度、多任務的綜合型計算系統。李斌介紹:“曙光8000覆蓋雙精度64位到32位、16位、8位甚至更低精度,也提供靈活混合精度調用能力,可滿足科學計算、大模型訓練、人工智能推理、工業仿真等計算需求。”
  從千卡、萬卡到10萬卡,計算基礎設施的建設邏輯也在發生變化。與千卡、萬卡級系統相比,10萬卡部署考驗的不只是計算卡數量和理論峰值性能,更包括系統架構、網絡互聯、存儲訪問、能效控制、資源調度和工程交付能力。
  系統創新造就“超級工程”
  這樣一個巨大的綜合型計算系統,是名副其實的“超級工程”:30億顆電子元器件實現精密協同,互聯線纜總長超1600公裡,系統總重1500噸……而這一切,需要被壓縮在不足0.05毫米的結構組裝精度之內——甚至比一張普通A4紙還薄。
  在系統建設上,曙光8000具有“芯片、計算、存儲、網絡、散熱、應用、服務”全鏈路全自研人工智能基礎設施能力,從核心部件的研制到系統落地均實現全國產化。
  “從萬卡到10萬卡,不是簡單乘以10,更要在規模擴大之后讓它‘跑’出應有的性能效率。”李斌舉例,算力協同方面,隨著體系結構向復雜的異構計算演進,任何計算或網絡節點的短板,都會導致整體性能大幅衰減﹔系統可靠性方面,元器件數量上升會導致理論故障率的上升,系統架構的復雜化又會進一步加劇維持穩定運行的難度。
  應對這些挑戰,並沒有太多的捷徑可走。曙光8000研制過程中,任何一個板卡所要求的可靠性都要比通用計算設備高出一個數量級。而供電、冷卻等支撐系統的設計和制造環節,更是耗費了團隊大量的心血,用李斌的話說,“曙光8000需要的是前所未有的系統創新”。
  值得一提的是,國產算力芯片及基礎軟硬件生態的長足進步,為曙光8000系統建設提供了重要支撐。比如,曙光8000應用的分布式存儲技術,在今年6月發布的全球存儲系統性能基准測試IO500榜單中,取得生產型全節點和10節點榜單“雙榜第一”的好成績。這套存儲系統能夠支撐大模型訓練和科學計算中的海量數據讀寫,保障大規模集群高效運行,証明國產高端存儲技術已在全球算力體系中具備領先實力。
  我國自主研發的相變浸沒液冷技術,為應對大規模計算集群散熱挑戰提供了新途徑。曙光數創高級副總裁張鵬介紹:“曙光8000將全部計算設備浸沒在氟化液中進行降溫。氟化液沸點在50攝氏度左右,而設備運行溫度在80至90攝氏度之間,當設備運行溫度上升后,氟化液就會沸騰相變,並由傳輸管道進入冷凝器,冷卻后的氣體再次轉換為氟化液,可實現閉環循環利用。”
  此外,高速網絡、數字孿生運維和多元融合調度等技術,共同提升了超大規模集群的運行效率和應用適配能力。在業內專家看來,打通芯片、整機、基礎軟件到智能應用的全棧國產化鏈路,構建新一代智能基礎設施,具有深遠的戰略意義。
  支撐算力產業“攀高峰”“建高原”
  建好更要用好。作為全國首個10萬卡級超算、智算融合的算力資源池,曙光8000投用后即同步接入國家超算互聯網,並依托國家超算互聯網接入全國一體化算力網,面向科研院所和產業用戶提供算力服務,支撐氣象預測、材料設計、能源勘探、生物醫藥、量子計算、流體仿真、工業仿真、大模型訓練與推理等場景,並形成更大范圍的算力協同和應用支撐。
  “我國算力產業既要‘攀高峰’,也要‘建高原’。”國家高性能計算機工程技術研究中心副主任曹振南說,“攀高峰”就是採用自主技術,研制世界上頂尖的計算機和系統﹔“建高原”就是依托國家超算互聯網,把機器、超算中心連接起來,更把人才、應用和生態連接起來。
  2024年4月,由國家部委指導發起建設的國家超算互聯網正式上線,已建成匯聚超350萬CPU(中央處理器)核、25萬GPU(計算加速卡)卡的全國規模最大一體化算力網絡與應用服務平台。國家超算互聯網鄭州核心節點上線后,國家超算互聯網面向新用戶推出普惠資源包,包含200卡時算力、1000萬詞元調用額度和500G存儲資源,並可選用主流大模型。高校師生和青年科研團隊可以用更低成本完成模型測試、算法驗証和科學計算實驗﹔人工智能開發者和中小企業則可以在正式投入前快速完成應用原型搭建和模型驗証。
  國家超算互聯網總工程師郭慶介紹,除支撐重大科研攻關外,國家超算互聯網正推動算力向更廣泛的用戶群體滲透,目前國家超算互聯網累計用戶超140萬,用戶平均年齡持續降低,從中學生到專業科研人員均可接觸到高端算力資源。
  據介紹,曙光8000已完成300余項重點應用深度適配,覆蓋20多個行業領域。在典型場景中,該系統已支撐新一代氣象大模型開發部署,推動能源領域核心成像算法在國產化平台上的移植優化,並在生物、材料、流體等領域支撐蛋白質折疊過程模擬加速等超大規模任務。
  “過去一年,我們基於國家超算互聯網的底座,構建了若干科學計算智能體,將原來復雜的科學計算流程封裝成簡便易用的基於自然語言交互的智能體服務,已經覆蓋100多個核心計算場景。”曙光智算總裁何牧君介紹。
  曙光8000不僅是單項技術突破和產品創新,更是產學研用協同的成果。近年來,中科曙光圍繞國產通用計算平台構建產業生態系統聯合體,旨在解決國產計算平台生態碎片化問題,推動自主可控信息技術生態的發展,目前已匯聚超過6000家產業合作伙伴,共同推動我國計算產業發展。

  《 人民日報 》( 2026年07月27日   19 版)
                                              
                               
                (責編:楊光宇、胡永秋)
                                關注公眾號:人民網財經
頁: [1]
查看完整版本: “超級大腦”運轉起來(深度觀察)