生成式人工智能(GenAI)——幫助優(yōu)化全球功率最密集的計算應用

時間：2024-08-14 17:44:46

關鍵字：生成式人工智能電源架構

手機看文章

掃描二維碼
隨時隨地手機看文章

[導讀]業(yè)界需要一種新的供電架構來控制生成式人工智能訓練模型的能源消耗

訓練生成式人工智能(GenAI)神經(jīng)網(wǎng)絡模型通常需要花費數(shù)月的時間，數(shù)千個基于GPU并包含數(shù)十億個晶體管的處理器、高帶寬SDRAM和每秒數(shù)太比特的光網(wǎng)絡交換機要同時連續(xù)運行。雖然人工智能有望帶來人類生產(chǎn)力的飛躍，但其運行時能耗巨大，所以導致溫室氣體的排放也顯著增加。

據(jù)《紐約時報》報道，到2027年，人工智能服務器每年的用電量將達到85至134太瓦時，大致相當于阿根廷一年的用電量。

為了應對日益加劇的能耗挑戰(zhàn)，AI處理器的供電網(wǎng)絡經(jīng)歷了多代的發(fā)展。這種全面的演進發(fā)展涉及電路架構、電源轉換拓撲、材料科學、封裝和機械/熱工程方面的創(chuàng)新。

生成式人工智能訓練處理器的供電方案負載點模式和分比式模式的演變：

從2020年到2022年，熱設計功率(TDP)幾乎翻了一番，從400W增加到了700W。TDP指標是指生成式人工智能訓練應用中GPU引擎的連續(xù)功耗。自2022年起，半導體行業(yè)的TDP水平不斷攀升，到了2024年3月，市場上甚至出現(xiàn)了一款TDP高達1000W的GPU。

圖1：基于GPU的生成式人工智能訓練處理器芯片復合體，加速器模塊(AM)上安裝有高帶寬存儲器(HBM)

用于生成式人工智能訓練的處理器復合體集成了一個GPU或ASIC芯片，以及六到八個高帶寬存儲器(HBM)芯片。采用4納米CMOS 工藝的GPU通常以0.65V的內核VDD運行，可能包含1000億或更多的晶體管。HBM提供144GB的存儲容量，其工作電壓一般為1.1V或1.2V。該處理器的一個關鍵供電特性與人工神經(jīng)網(wǎng)絡算法負載有關。對比處于空閑狀態(tài)的GPU和算法滿載狀態(tài)的GPU，瞬態(tài)電流消耗(dI/dt)差別可能非常大，可能達到每微秒2000安培或更多。此外，該處理器不能容忍較大的電源電壓下沖或過沖幅值;這些負載階躍瞬變必須限制在標稱VDD的10%以內。設計用于生成式人工智能訓練處理器的供電解決方案時，由于這些動態(tài)操作條件的原因，峰值電流輸送能力通常設計為連續(xù)電流輸送能力的兩倍，峰值事件通常持續(xù)數(shù)十毫秒(圖1)。

對于CPU、FPGA、網(wǎng)絡交換機處理器以及現(xiàn)在的AI訓練和推理芯片發(fā)展最重要的供電架構是負載點(PoL)方法。相較于傳統(tǒng)的多相并聯(lián)電源架構，分比式PoL電源架構實現(xiàn)了更高的功率和電流密度。這種電源架構借鑒了理想變壓器的“匝數(shù)比”概念，通過分壓實現(xiàn)電流倍增。電流倍增的可擴展性使我們能夠根據(jù)不同的輸出電壓和電流需求，開發(fā)一系列全面的PoL轉換器。這對客戶來說至關重要，因為高級AI訓練處理器的需求正快速變化。

圖2：分比式電源架構可以提供超過1000安培的大電流，并使供電網(wǎng)絡的電阻降低到1/20

分比式電源架構(FPA)——分解為穩(wěn)壓和變壓兩部分功能

生成式人工智能電源系統(tǒng)設計面臨的主要挑戰(zhàn)包括：

· 很高的電流輸送能力，范圍從500安培到2000安培

· 負載需要出色的動態(tài)性能

· PDN的損耗和阻抗較大

· 48V母線基礎架構的標準化使用，需要從48V轉換到1V以下的能力

要解決這種大電流和高密度負載點(PoL)問題，需要采用不同的方法。先進的分比式電源架構將穩(wěn)壓和變壓/電流倍增功能進行了分解，可將這些供電級放置在最佳位置，從而達到最高的效率和功率/電流密度。

當輸入電壓(VIN)等于輸出電壓(VOUT)時，穩(wěn)壓器的效率最高，隨著輸入輸出比的增加，效率逐漸降低。在36至60V的典型輸入電壓范圍內，最佳輸出母線電壓將是48V，而不是中間母線架構(IBA)中常見的傳統(tǒng)12V母線電壓。48V輸出母線所需的電流是12V母線的四分之一(P=VI)，而PDN的損耗是電流的平方(P = I2R)，這意味著損耗降低至原來的 1/16。因此，先安裝穩(wěn)壓器并將其調節(jié)至48V輸出，可以實現(xiàn)最高的效率。穩(wěn)壓器還必須接受有時低于48V的輸入電壓，這就需要一個降壓-升壓的功能來滿足這一設計需求。一旦輸入電壓得到了穩(wěn)壓，下一步便是將48V轉換為1V。

在需要為1V負載供電的情況下，最佳變壓比為48:1。在這種情況下，穩(wěn)壓器將輸入電壓降壓或升壓到48V輸出，再由變壓器將電壓從48降至1V。降壓變壓器以相同的比率加大電流，因此變壓器組件也可以稱為電流倍增器。在這種情況下，1安培的輸入電流將倍增至48安培的輸出電流。為了最大限度地減少大電流輸出的PDN損耗，電流倍增器必須小巧，以便盡可能靠近負載放置。

PRM穩(wěn)壓器和VTM/MCM模塊化電流倍增器結合在一起，構成Vicor分比式電源架構。這兩個器件相互合作，各司其職，實現(xiàn)完整的DC-DC轉換功能。

PRM通過調制未穩(wěn)壓的輸入電源提供穩(wěn)壓輸出電壓，即“分比式母線電壓”。該母線供電給VTM，由VTM將分比式母線電壓轉換為負載所需的電平。

與IBA不同，F(xiàn)PA不通過串聯(lián)電感器從中間母線電壓降壓至PoL。FPA不通過降低中間母線電壓來平均電壓，而是使用電流增益為1:48或更高的高壓穩(wěn)壓和電流倍增器模塊，以提供更高的效率、更小的尺寸、更快的響應和1000安培及以上的可擴展性(圖2)。

垂直放置PoL轉換器減少功耗耗散

在前幾代大電流生成式人工智能處理器電源架構中，PoL轉換器被放在處理器復合體的橫向(旁邊)位置。由于銅的電阻率和PCB上的走線長度，橫向放置的PoL供電網(wǎng)絡(PDN)的集總阻抗相當高，可能達到200μΩ或更高。隨著生成式人工智能訓練處理器的連續(xù)電流需求增加到1000安培，這意味著PCB本身就會消耗掉200瓦的功率?？紤]到在AI超級計算機中用于大型語言模型訓練的加速器模塊(AM)多達數(shù)千個，而且?guī)缀鯊牟粩嚯?，通常會持續(xù)運行10年或更長時間，這200瓦的功率損耗在整體上變得非常龐大。

認識到這種能源浪費后，AI計算機設計師已經(jīng)開始評估采用垂直供電(VPD)結構，將PoL轉換器直接放置在處理器復合體的下方。在垂直供電網(wǎng)絡中，集總阻抗可能降至10μΩ或更低，這意味著在內核電壓域1000安培的連續(xù)電流下，只會消耗10瓦的功率。也就是說，通過將PoL轉換器從橫向放置改為縱向放置，PCB的功耗減少了200–10=190瓦(WPCB )(圖3)。

圖3 生成式人工智能加速模塊從橫向(頂部)供電改為縱向(背部)供電，可將PDN損耗降低至1/20

VPD的另一個優(yōu)點是降低了GPU芯片表面電壓梯度，這也有助于節(jié)省電力。如前所述，典型的4納米CMOS GPU的標稱工作電壓為0.65VDD。使用橫向供電時，將電源提供給處理器復合體的四邊，由于集成電路的配電阻抗較高(通常使用電阻率高于銅的鋁導體)，可能需要0.70V的電壓，才能確保GPU芯片中心的電壓達到標稱值0.65V。而采用縱向供電時，可以確保整個芯片表面的電壓為0.65V。0.70–0.65=50 mV，這個差值乘以1000安培，可額外節(jié)省50瓦(WVDD)的功率。在本例中，節(jié)省的總功率為190 WPCB + 50 WVDD = 240瓦(圖4)。

根據(jù)未來幾年公共領域對加速器模塊(AM)需求的預測(2024年超過250萬件)，以及對電力成本的合理估計(每兆瓦時75美元)，每個AM節(jié)省240W電力，到2026年將在全球范圍內實現(xiàn)太瓦時的電力節(jié)省，相當于每年節(jié)約數(shù)十億美元的電力運營成本，而且根據(jù)可再生能源的使用比例，每年還能永久性地減少數(shù)百萬噸的二氧化碳排放。

圖4：使用VPD時，處理器芯片的表面電壓均勻，有助于最大限度地提高計算性能，同時最小化功率損耗

遏制失控的生成式人工智能功耗

Vicor正引領生成式人工智能供電技術的創(chuàng)新浪潮。他們提供的分比式負載點轉換器解決方案有助于提升生成式人工智能處理器的功效，使生成式人工智能的功耗與社會層面的環(huán)境保護和節(jié)能目標相一致。

Vicor持續(xù)推動電源架構的創(chuàng)新，并開發(fā)先進的新產(chǎn)品，致力于解決生成式人工智能模型訓練帶來的功耗增加問題。通過采用先進的分比式電流倍增器方法進行負載點DC-DC轉換，就可以充分發(fā)揮生成式人工智能優(yōu)勢，同時有效控制全球范圍內的能源消耗。

本站聲明：本文章由作者或相關機構授權發(fā)布，目的在于傳遞更多信息，并不代表本站贊同其觀點，本站亦不保證或承諾內容真實性等。需要轉載請聯(lián)系該專欄作者，如若文章內容侵犯您的權益，請及時聯(lián)系本站刪除。

換一批

賦能人工智能未來：ADI宣布支持800 VDC數(shù)據(jù)中心架構

人工智能(AI)的迅速發(fā)展開啟了高密度計算需求的新時代，而傳統(tǒng)電源架構逐漸難以適應這一需求發(fā)展。為更好地響應此類需求，Analog Devices, Inc. (ADI)推出創(chuàng)新解決方案，為數(shù)據(jù)中心下一代800 VDC架...

關鍵字：人工智能數(shù)據(jù)中心電源架構

[ADI]

優(yōu)先考慮電源架構的優(yōu)化

與計算和仿真工具相比，電源架構的設計工具并未得到廣泛使用。然而，這些工具在電路電源系統(tǒng)的開發(fā)過程中起到至關重要的作用。作為電源開發(fā)流程的初始環(huán)節(jié)，這些工具為創(chuàng)建出色的電源架構奠定了基礎。

關鍵字：電源架構電路電源系統(tǒng) 電源管理

[極客網(wǎng)]

國際勞工組織報告：全球25%就業(yè)崗位或受生成式人工智能影響

近日，國際勞工組織（ILO）與波蘭國家研究院發(fā)布聯(lián)合研究報告《生成式人工智能與就業(yè)：全球職業(yè)受影響程度精編指數(shù)》，對生成式人工智能如何重塑勞動世界進行了迄今最詳盡的評估。

關鍵字：生成式人工智能 AI 人工智能

[亞馬遜云科技]

萬代南夢宮娛樂在亞馬遜云科技云上構建高達元宇宙

Amazon GameLift Streams為全球粉絲提供低延遲、高質量、沉浸式的元宇宙體驗

關鍵字：元宇宙生成式人工智能 3D 圖形

[電源]

48V 系統(tǒng)：引領汽車電源架構的重大變革

在汽車產(chǎn)業(yè)的發(fā)展歷程中，電源架構的每一次變革都深刻影響著車輛的性能、效率與功能拓展。從早期的 6V 系統(tǒng)到后來占據(jù)主導地位長達 60 年的 12V 系統(tǒng)，每一次電壓標準的提升都是為了應對汽車日益增長的電力需求。而如今，隨...

關鍵字：電源架構電力需求 48V

[極客網(wǎng)]

美國《商業(yè)內幕》：蘋果阿里AI合作難改iPhone在華銷量頹勢

蘋果公司與阿里巴巴集團達成合作，計劃在中國推出生成式人工智能（AI）服務Apple Intelligence。然而，盡管這一合作被視為蘋果推動iPhone在華銷量的舉措，但美國《商業(yè)內幕》分析認為，其效果可能并不樂觀。

關鍵字：蘋果阿里巴巴生成式人工智能 AI

[亞馬遜云科技]

Amazon Bedrock全新升級，新增業(yè)界領先的AI防護、新智能體功能和模型定制能力

Amazon Bedrock新增自動化推理檢查、多智能體協(xié)作和模型蒸餾三項新功能，基于堅實的企業(yè)級功能基礎構建，助力客戶更快地從概念驗證過渡到生產(chǎn)級的生成式人工智能

關鍵字：生成式人工智能模型蒸餾

[極客網(wǎng)]

全球云計算市場繼續(xù)高速增長，三季度支出838億美元再創(chuàng)新高

根據(jù)研究機構Synergy Research集團日前發(fā)布的一份市場分析報告，2024年第三季度，全球企業(yè)在云計算基礎設施服務上的支出達到838億美元，與去年同期相比增長23%。

關鍵字：云計算生成式人工智能 GenAI 電信業(yè)

[Molex莫仕]

Molex莫仕發(fā)布最新行業(yè)報告，探討48V系統(tǒng)的發(fā)展，關注汽車電源架構的重大變革

伊利諾伊州萊爾 – 2024年10月15日 – 全球電子行業(yè)的領軍企業(yè)及連接技術創(chuàng)新者Molex莫仕公司發(fā)布了一份報告，探討48V電氣系統(tǒng)技術迅速興起，這項技術有望大幅提升汽車性能、效率、功能性和舒適性。Molex莫仕公...

關鍵字：電源架構 48V電氣系統(tǒng) 連接器

[電源]

非隔離DC/DC電源降壓模塊因其獨特的優(yōu)勢

在數(shù)據(jù)采集(DAQ)系統(tǒng)中，電源架構的設計是確保系統(tǒng)穩(wěn)定運行和高效性能的關鍵因素之一。隨著技術的不斷進步，非隔離DC/DC電源降壓模塊因其獨特的優(yōu)勢，在DAQ應用中得到了廣泛應用。本文將深入探討在DAQ系統(tǒng)中使用非隔離D...

關鍵字：數(shù)據(jù)采集電源架構 DAQ