Обучите LLM с нуля с параметром 1,38B, Pretrain+SFT+RL (GRPO/GSM8K) на одном RTX 5090 (32 ГБ). Перенесено из наночата Карпати (6ed7d1d, 9 марта 2026 г.) в один файл Python размером ~2 КБ. — 22 апреля 2026 г.: добавлено — 27 марта 2026 г.: exl3 bpw4 и bpw8 через exllamav3 v0.0.27 — 23 марта 2026 г.: первоначальный выпуск ChatCORE без HumanEval (5/6 задач). Официальный d20 SFT из обсуждения №1. d30 приблизительно, отчеты сообщества.* 24 слоя, 1536 скрытых тусклых элементов, 12 заголовков MHA (head_dim=128), 32 тыс. слов BPE, 2048 контекстов. RoPE (theta=100k), QK-norm, невзвешенное RMSNorm, несвязанные внедрения, активация ReLU², logit softcap 15.0, внедрения значений на чередующихся уровнях (~604M параметров при почти нулевых FLOP), остаточные скаляры для каждого слоя, механизм размазывания, механизм возврата, полный контекст cuDNN SDPA. Примечания: — RL для одного графического процессора требует косинусного распада LR, чтобы избежать коллапса политики (линейный LR расходится после шага 400) — FP8 на SM120 требует однострочного патча индуктора Triton (getattr(binary.metadata, ‘clusterdims’, (1, 1, 1))`) — Бонус энтропии (в стиле GTPO) усугубил коллапс, градиентный шум — настоящая проблема Root = RL (шаг) 300, лучший проход@4). Папки pt/ и sft/ имеют базовые контрольные точки и контрольные точки SFT.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Nekochu
Теги: nanochat, karpathy, single-gpu, rtx-5090, conversational, en, model-index
Лайков: 5 | Загрузок: 370
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.