計算機組織與結構›Ch6 記憶體(Memory)
第 5 題/共 83 題
◀ CC 5/83
5. LLM Inference、Quantization、Memory Hierarchy、Cache
#CC-06-005中LLM InferenceQuantizationMemory HierarchyCache

關於 LLM 推論(inference)、量化(quantization)與記憶體階層,考慮在一個具有下列規格的 CPU 系統上執行大型語言模型推論:

  • L1 cache:每核心 32 KB,延遲 4 cycles
  • L2 cache:每核心 256 KB,延遲 12 cycles
  • L3 cache:共享 32 MB,延遲 40 cycles
  • 主記憶體:64 GB DDR5,延遲 200 cycles,頻寬 50 GB/s
  • 模型共有 70 億個參數

下列程式碼針對一個 transformer layer 執行單次矩陣向量乘法:

// 權重矩陣 W: 4096 x 4096,activation 向量 x: 4096
// FP16: 每元素2 bytes,INT8: 每元素1 byte,INT4: 每元素0.5 bytes
void matvec(void *W, float *x, float *y, int N, int precision) {
    for (int i = 0; i < N; i++) {
        float sum = 0;
        for (int j = 0; j < N; j++) {
            float w = dequantize(W, i, j, precision);
            sum += w * x[j];
        }
        y[i] = sum;
    }
}

請選出正確的敘述。

📄 台大115
跳轉到第題
▤完整推導請見《WH 資工筆記 · 計算機組織與結構》Ch6 記憶體(Memory)
本章題號 · 1–20 / 83