AI—06 · NGÔN NGỮDọn data SFT
Dọn data SFT
trước khi train.
Dán JSONL vào để nhận dạng OpenAI, ShareGPT hoặc Alpaca, tìm lỗi cấu trúc, đổi format và kiểm tra mẫu vượt context.
INPUT · JSONL
Mỗi dòng một mẫu, format lẫn lộn cũng được
3 FORMAT PHỔ BIẾN
- OpenAI messages —
{"messages":[{"role":"user","content":"…"}]} - ShareGPT —
{"conversations":[{"from":"human","value":"…"}]} - Alpaca —
{"instruction":"…","input":"…","output":"…"}
KIỂM TRA & CONVERT
3 mẫu hợp lệ
3Mẫu hợp lệ / 3
1 openai · 1 sharegpt · 1 alpacaFormat phát hiện
34~Token mẫu dài nhất
0Mẫu vượt context 4096
| Dòng | Format | Lượt | ~Token | Kiểm tra |
|---|---|---|---|---|
| 1 | OpenAI | 3 | 34 | OK |
| 2 | ShareGPT | 2 | 16 | OK |
| 3 | Alpaca | 2 | 28 | OK |
OUTPUT · OPENAI MESSAGES
JSONL đã chuẩn hóa
Chỉ mẫu không có lỗi kiểm tra mới được đưa vào output. Ước token theo heuristic ~4 ký tự/token — cần số chính xác thì dán một mẫu vào AI Text Lab với tokenizer thật. Convert sang Alpaca sẽ gộp system vào instruction và chỉ giữ lượt hỏi–đáp đầu tiên (giới hạn của format đó).
Dataset chỉ được xử lý trong tab này.
Không có nội dung fine-tune nào được gửi lên server.