ChatGPT的爆發(fā)讓很多人第一次意識到,支撐大語言模型運(yùn)行的不是普通服務(wù)器,而是專門為并行計(jì)算優(yōu)化的GPU集群。但GPU在AI領(lǐng)域的角色遠(yuǎn)不止推理這一個環(huán)節(jié),從模型訓(xùn)練、數(shù)據(jù)預(yù)處理到實(shí)時(shí)推斷,GPU已經(jīng)成為整個AI基礎(chǔ)設(shè)施的核心計(jì)算單元。
本文解釋GPU為什么適合AI計(jì)算、它在哪些行業(yè)真正發(fā)揮價(jià)值,以及企業(yè)在實(shí)際選型時(shí)需要考慮什么。
傳統(tǒng)CPU的設(shè)計(jì)邏輯是"少量高性能核心串行處理復(fù)雜任務(wù)",主流服務(wù)器CPU通常有8~128個核心,擅長處理邏輯分支多、依賴關(guān)系復(fù)雜的計(jì)算。
深度學(xué)習(xí)的計(jì)算特點(diǎn)恰好相反:神經(jīng)網(wǎng)絡(luò)的訓(xùn)練本質(zhì)上是大規(guī)模矩陣乘法運(yùn)算,每次迭代需要對數(shù)億個參數(shù)同時(shí)做相似的簡單計(jì)算。這類任務(wù)對CPU來說是嚴(yán)重的資源錯配,核心數(shù)太少,并行能力不足。
GPU最初為圖形渲染而設(shè)計(jì),一塊消費(fèi)級GPU就有數(shù)千個簡單計(jì)算核心,專為并行處理大量相同操作而優(yōu)化。英偉達(dá)H100擁有約14,592個CUDA核心,配合高帶寬顯存(HBM2e/HBM3),在矩陣運(yùn)算上的吞吐量比頂級CPU高出數(shù)十倍。
這就是為什么訓(xùn)練一個中等規(guī)模的語言模型,用CPU可能需要數(shù)年,用GPU集群可以壓縮到數(shù)天甚至數(shù)小時(shí)。
GPU在AI工作流中承擔(dān)兩類截然不同的任務(wù),對硬件的要求也不一樣。
模型訓(xùn)練
訓(xùn)練階段需要反復(fù)向模型喂入海量數(shù)據(jù),通過反向傳播不斷調(diào)整參數(shù)權(quán)重,直到模型收斂。這是計(jì)算密集度最高的環(huán)節(jié):
數(shù)據(jù)量越大、模型層數(shù)越多,所需顯存和算力越高
GPT-3(1750億參數(shù))的訓(xùn)練據(jù)估算消耗了約3640個PF-day的算力
訓(xùn)練通常需要多GPU甚至多機(jī)多卡并行,對顯存帶寬、節(jié)點(diǎn)間互聯(lián)速度(NVLink/InfiniBand)要求極高
目前主流訓(xùn)練芯片包括英偉達(dá)A100/H100、AMDMI300X,以及國產(chǎn)的華為昇騰910B。
模型推理
訓(xùn)練完成的模型部署到生產(chǎn)環(huán)境,接收用戶請求并輸出結(jié)果,這個過程叫推理。推理對硬件的要求與訓(xùn)練有明顯差異:
更看重延遲(響應(yīng)速度)和吞吐量(并發(fā)處理能力),而非峰值算力
單次推理顯存占用遠(yuǎn)小于訓(xùn)練,可以在更低配置的GPU上運(yùn)行
大規(guī)模部署時(shí)成本敏感,英偉達(dá)L40S、L4等推理優(yōu)化卡比A100性價(jià)比更高
量化(INT8/FP8)和模型壓縮技術(shù)可以在損失極少精度的前提下大幅降低推理成本
醫(yī)療健康
醫(yī)學(xué)影像分析是GPU在醫(yī)療領(lǐng)域落地最成熟的方向之一。CT、MRI圖像的病灶識別、腫瘤分割,GPU加速的卷積神經(jīng)網(wǎng)絡(luò)(CNN)在某些任務(wù)上的準(zhǔn)確率已經(jīng)接近甚至超過經(jīng)驗(yàn)豐富的影像科醫(yī)生,且處理速度從數(shù)小時(shí)壓縮到分鐘級。
藥物研發(fā)方向,AlphaFold2對蛋白質(zhì)結(jié)構(gòu)預(yù)測的突破就是GPU算力支撐深度學(xué)習(xí)的典型案例,此前人工研究一個蛋白質(zhì)結(jié)構(gòu)需要數(shù)年,AlphaFold2幾分鐘內(nèi)完成預(yù)測。
自動駕駛
自動駕駛車輛需要實(shí)時(shí)處理來自多個攝像頭、激光雷達(dá)、毫米波雷達(dá)的傳感器數(shù)據(jù),融合后做出駕駛決策,整個推理鏈路的延遲要求在毫秒級。
這類場景對GPU的要求是:低延遲、低功耗、高可靠性。英偉達(dá)的Orin芯片(用于車端)和DriveThor(下一代)就是專為這個場景設(shè)計(jì)的邊緣推理芯片。數(shù)據(jù)中心側(cè),大量仿真訓(xùn)練數(shù)據(jù)的生成和模型迭代同樣依賴GPU集群。
金融風(fēng)控
欺詐檢測需要在毫秒內(nèi)對每一筆交易做出判斷,GPU加速的實(shí)時(shí)推理引擎可以在支付完成之前完成風(fēng)險(xiǎn)評分。量化交易領(lǐng)域,GPU用于高速處理市場數(shù)據(jù)、運(yùn)行復(fù)雜因子模型和實(shí)時(shí)回測。
與其他行業(yè)不同,金融場景對模型可解釋性要求較高,純黑盒深度學(xué)習(xí)模型的監(jiān)管合規(guī)問題仍是行業(yè)面臨的實(shí)際挑戰(zhàn)。
網(wǎng)絡(luò)安全
異常流量檢測、入侵行為識別、惡意代碼分類,這些任務(wù)的共同特點(diǎn)是數(shù)據(jù)量大、實(shí)時(shí)性要求高、正常與異常的邊界模糊。GPU加速的深度學(xué)習(xí)模型可以從海量日志中識別人工規(guī)則難以捕捉的攻擊模式,尤其是針對零日漏洞和APT攻擊的檢測效果明顯優(yōu)于傳統(tǒng)規(guī)則引擎。
內(nèi)容生成與AIGC
文生圖(StableDiffusion、Midjourney)、文生視頻(Sora類模型)、大語言模型(GPT、Claude、Llama系列),這些是當(dāng)前GPU需求增長最快的方向。
推理側(cè),單個用戶的對話請求對GPU要求不高,但規(guī)模化并發(fā)時(shí)算力消耗急劇放大。以一個中等體量的AI產(chǎn)品為例,日活10萬用戶、平均每次對話10輪,按Llama-370B模型估算,每天的推理算力需求大約需要4~8張A100才能支撐。
科學(xué)計(jì)算
氣候模型、分子動力學(xué)模擬、天體物理計(jì)算,這些領(lǐng)域的共同特點(diǎn)是計(jì)算規(guī)模超出傳統(tǒng)CPU集群的處理能力,而GPU的大規(guī)模并行計(jì)算能力正好契合。以氣候模擬為例,過去需要運(yùn)行數(shù)周的全球氣候模型,在GPU集群支撐下可以壓縮到數(shù)小時(shí)。
框架 | 主要用途 | GPU支持 |
PyTorch | 科研優(yōu)先,LLM訓(xùn)練主流框架 | 完整CUDA支持,動態(tài)圖靈活 |
TensorFlow/Keras | 工業(yè)部署,Google生態(tài) | GPU/TPU均支持 |
JAX | 高性能科學(xué)計(jì)算、谷歌內(nèi)部首選 | 原生XLA編譯加速 |
PaddlePaddle | 百度生態(tài),國內(nèi)落地廣泛 | 支持英偉達(dá)GPU和昇騰 |
MindSpore | 華為生態(tài),昇騰芯片原生支持 | 國產(chǎn)芯片適配最好 |
當(dāng)前趨勢是PyTorch在研究和LLM訓(xùn)練領(lǐng)域的主導(dǎo)地位持續(xù)鞏固,工業(yè)部署側(cè)則出現(xiàn)了更多針對推理優(yōu)化的專用框架(vLLM、TensorRT-LLM)
首先區(qū)分訓(xùn)練還是推理需求
訓(xùn)練需要最大顯存(80GB+)和最高算力,優(yōu)先A100/H100;推理更看重性價(jià)比,L40S、L4或消費(fèi)級4090在中小規(guī)模部署中往往更劃算。
顯存是最先碰到的瓶頸
模型參數(shù)量決定最低顯存需求:7B參數(shù)模型FP16精度大約需要14GB顯存,70B模型需要140GB(即多卡并行)。購買前先算清楚自己的模型尺寸和batchsize需求。
多卡互聯(lián)不可忽視
多GPU訓(xùn)練時(shí),卡間通信帶寬往往成為瓶頸。NVLink(英偉達(dá)專有)比PCIe帶寬高出5~10倍,A100/H100SXM版本支持NVLink,PCIe版本不支持,這個差異在大規(guī)模訓(xùn)練時(shí)影響顯著。
散熱和功耗
H100單卡TDP700W,滿負(fù)載運(yùn)行的8卡服務(wù)器功耗超過6kW,對機(jī)房制冷和電力供應(yīng)要求極高。選擇托管GPU服務(wù)器時(shí),機(jī)房的功率密度和散熱能力是必須確認(rèn)的前提條件。
對于沒有自建機(jī)房條件的企業(yè),租用GPU服務(wù)器是更現(xiàn)實(shí)的路徑。恒訊科技提供的GPU服務(wù)器方案覆蓋以下場景:
節(jié)點(diǎn)位置與線路:香港、新加坡、美國等主要節(jié)點(diǎn)均有GPU資源,CN2GIA線路保障國內(nèi)團(tuán)隊(duì)訪問延遲(香港節(jié)點(diǎn)約15~30ms),適合需要國內(nèi)研發(fā)團(tuán)隊(duì)頻繁調(diào)用的訓(xùn)練和推理任務(wù)。
適用場景:中小規(guī)模模型訓(xùn)練、AI推理API部署、AIGC應(yīng)用后端、企業(yè)私有化大模型部署。對于不需要A100/H100量級算力的場景(如私有化部署7B~13B開源模型、圖像生成服務(wù)、實(shí)時(shí)推理API),恒訊科技這類服務(wù)商的GPU服務(wù)器方案在成本上比國內(nèi)主流云廠商更有競爭力,且支持按月計(jì)費(fèi),避免長期綁定。
T3+機(jī)房標(biāo)準(zhǔn),冗余供電和制冷保障GPU滿負(fù)載運(yùn)行的穩(wěn)定性,這一點(diǎn)在高功耗GPU場景下尤為重要。
Copyright ? 2013-2020. All Rights Reserved. 恒訊科技 深圳市恒訊科技有限公司 粵ICP備20052954號 IDC證:B1-20230800.移動站


