AI—28 · TOÁN & MÔ HÌNH

Mở một block
Transformer ra xem.

Xem shape và số parameter của từng phần, rồi tự tính QKᵀ, softmax và weighted sum trên bốn token mẫu.

CẤU HÌNH

Chọn cỡ model

d_model768
Số head12 · head_dim 64
12
Context (T)2.048
32.000
111.2 MTổng tham số
7.1 MMỗi block (12d² + 13d)
72 MBKV cache đầy context (FP16)
50.3 MÔ ma trận attention / block
BẢNG GIẢI PHẪU · MỖI BLOCK

Đường đi của một token qua block

Thành phầnShapeParamsGhi chú
Token embedding32.000 × 76824.6 Mtra bảng, thường tied với LM head
Positional (learned)2.048 × 7681.6 MRoPE thì không tốn param
LayerNorm ×22 × 2·7683.1 Kscale + bias mỗi LN
W_QKV768 → 3·7681.8 Mmột phép chiếu ra đủ Q, K, V
W_out (attn proj)768 → 768590.6 Kgộp các head lại
MLP lên768 → 30722.4 Mnở ra 4×
MLP xuống3072 → 7682.4 Mép về d_model
1 blockLN + attention + MLP7.1 M× 12 block
Cả modelembed + 12 block + LN cuối111.2 MLM head tied với embedding

Quy tắc nhớ nhanh: block ≈ 12·d_model² — attention chiếm 4d², MLP chiếm 8d². FLOPs suy luận ≈ 2 × params mỗi token. Ma trận attention phình theo T² — đây là lý do context dài tốn kém, và là thứ KV cache (tab Bộ nhớ của Math Lab) phải gánh.

Mọi phép tính đều ở trong tab này.

Không có dữ liệu nào được gửi lên server.