AI—28 · TOÁN & MÔ HÌNHMở một block
Mở một block
Transformer ra xem.
Xem shape và số parameter của từng phần, rồi tự tính QKᵀ, softmax và weighted sum trên bốn token mẫu.
CẤU HÌNH
Chọn cỡ model
111.2 MTổng tham số
7.1 MMỗi block (12d² + 13d)
72 MBKV cache đầy context (FP16)
50.3 MÔ ma trận attention / block
BẢNG GIẢI PHẪU · MỖI BLOCK
Đường đi của một token qua block
| Thành phần | Shape | Params | Ghi chú |
|---|---|---|---|
| Token embedding | 32.000 × 768 | 24.6 M | tra bảng, thường tied với LM head |
| Positional (learned) | 2.048 × 768 | 1.6 M | RoPE thì không tốn param |
| LayerNorm ×2 | 2 × 2·768 | 3.1 K | scale + bias mỗi LN |
| W_QKV | 768 → 3·768 | 1.8 M | một phép chiếu ra đủ Q, K, V |
| W_out (attn proj) | 768 → 768 | 590.6 K | gộp các head lại |
| MLP lên | 768 → 3072 | 2.4 M | nở ra 4× |
| MLP xuống | 3072 → 768 | 2.4 M | ép về d_model |
| 1 block | LN + attention + MLP | 7.1 M | × 12 block |
| Cả model | embed + 12 block + LN cuối | 111.2 M | LM head tied với embedding |
Quy tắc nhớ nhanh: block ≈ 12·d_model² — attention chiếm 4d², MLP chiếm 8d². FLOPs suy luận ≈ 2 × params mỗi token. Ma trận attention phình theo T² — đây là lý do context dài tốn kém, và là thứ KV cache (tab Bộ nhớ của Math Lab) phải gánh.
Mọi phép tính đều ở trong tab này.
Không có dữ liệu nào được gửi lên server.