計算機組織與結構›Ch3 效能評估(Performance)
第 3 題/共 35 題
◀ CC 3/35
3. Roofline Model、Arithmetic Intensity、LLM Edge Inference
#CC-03-003中Roofline ModelArithmetic IntensityLLM Edge Inference

(題組 G3:Designing Chips and Systems for Large Language Models,20分。情境:假設我們正在為一間晶片設計公司工作,該公司正嘗試設計LLM加速器,需要取得具代表性的workload並在設計過程中特徵化workload,持續用該workload評估晶片設計以找出效能瓶頸。)

MIT 的一組研究人員開發了一個名為 TinyChat 的 LLM,可在能源受限的邊緣裝置(weak, power-constrained edge devices)上執行。首先,他們在目標應用情境下對 TinyChat 的執行時間做了 profiling,以了解其 workload。這個 LLM workload 被拆分成兩個階段:Context stage 與 Generation Stage,profiling 結果顯示 Generation Stage 主導了執行時間,Generation 占了總執行時間(340ms)中的 310ms。此外,他們使用 arithmetic intensity 與 roofline model 來特徵化這個 workload,下圖回報了這兩個 stages 的 arithmetic intensity:

假設我們正在設計一個處理器晶片,並針對類似的應用微調(fine-tune)這個 LLM,請問下列敘述何者正確?

題目附圖
📄 台大113
跳轉到第題
▤完整推導請見《WH 資工筆記 · 計算機組織與結構》Ch3 效能評估(Performance)
本章題號 · 1–20 / 35