計算機組織與結構›Ch7 其他(Others)第 4 題/共 19 題
4. LLM Training、GPT-3、Parallel Computing
#CC-07-004中LLM TrainingGPT-3Parallel Computing
題組題幹(本題:G2-5,共 3 小題)點擊展開
Large Language Models and Computer Architecture,15分,附IEEE Spectrum文章《Intel and Nvidia Square Off in GPT-3 Time Trials》,內容描述MLPerf為GPT-3新增LLM benchmark、Nvidia H100與Intel Habana Gaudi2的訓練時間比較、FP8混合精度技術等。
訓練一個 GPT-3 模型並不容易,完整訓練一個 1750 億參數的網路加上完整訓練資料集可能需要數週時間並花費數百萬美元。根據文章,請問下列敘述何者正確?
📄 台大113
▤完整推導請見《WH 資工筆記 · 計算機組織與結構》Ch7 其他(Others)