Sử dụng thư viện SentencePiece Unigram với vocabulary 10.000 token. Tokenizer được huấn luyện trên dữ liệu tiếng Việt đã chuyển về chữ thường, giữ nguyên khoảng trắng và bật byte fallback để hạn chế token không xác định. Mỗi token ID được ánh xạ thành một vector có kích thước dmodel bằng nn.Embedding. Khác với Transformer trong bài báo Attention Is All You Need, vốn cộng sinusoidal positional encoding trực tiếp vào token embedding, SAI sử dụng Rotary Positional Embedding (RoPE)**. RoPE mã hoá vị trí tương đối bằng cách xoay các vector query và key trong attention. Context tối đa của mô hình là 2.048 token. Trọng số của output language-model head được chia sẻ với ma trận embedding (weight tying). Cách này giảm số tham số và buộc biểu diễn đầu vào, đầu ra cùng nằm trong một không gian token. Query, key và value được chiếu qua một lớp tuyến tính gộp không dùng bias. Nhiều query head có thể dùng chung một cặp key/value head, nhờ đó giảm kích thước KV cache so với Multi-Head Attention thông thường. — Cấu hình 35M có 8 query head và 8 KV head (tương đương Multi-Head Attention). — Cấu hình 100M có 12 query head và 6 KV head. — Cấu hình 500M có 16 query head và 8 KV head. Attention được…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: thongbuind
Теги: sai, custom-code, vietnamese, causal-lm, custom_code, vi
Лайков: 4 | Загрузок: 667
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.