AI—06 · NGÔN NGỮ

Dọn data SFT
trước khi train.

Dán JSONL vào để nhận dạng OpenAI, ShareGPT hoặc Alpaca, tìm lỗi cấu trúc, đổi format và kiểm tra mẫu vượt context.

INPUT · JSONL

Mỗi dòng một mẫu, format lẫn lộn cũng được

3 FORMAT PHỔ BIẾN
  • OpenAI messages{"messages":[{"role":"user","content":"…"}]}
  • ShareGPT{"conversations":[{"from":"human","value":"…"}]}
  • Alpaca{"instruction":"…","input":"…","output":"…"}
KIỂM TRA & CONVERT

3 mẫu hợp lệ

3Mẫu hợp lệ / 3
1 openai · 1 sharegpt · 1 alpacaFormat phát hiện
34~Token mẫu dài nhất
0Mẫu vượt context 4096
DòngFormatLượt~TokenKiểm tra
1OpenAI334OK
2ShareGPT216OK
3Alpaca228OK
OUTPUT · OPENAI MESSAGES

JSONL đã chuẩn hóa

Chỉ mẫu không có lỗi kiểm tra mới được đưa vào output. Ước token theo heuristic ~4 ký tự/token — cần số chính xác thì dán một mẫu vào AI Text Lab với tokenizer thật. Convert sang Alpaca sẽ gộp system vào instruction và chỉ giữ lượt hỏi–đáp đầu tiên (giới hạn của format đó).

Dataset chỉ được xử lý trong tab này.

Không có nội dung fine-tune nào được gửi lên server.