> Мы учим крошечные нейронные сети думать. иногда они нас удивляют. иногда они просто выводят нули. Blink — это, по большей части, второй вариант, и нам он все равно нравится. Blink — самая маленькая модель, созданная в ходе исследования Glitt. 1087 параметров. не 1,087 миллиарда, не 1,087 миллиона. одна тысяча восемьдесят семь реальных чисел. в блоге это отображается как «модель отладки 1k», которую мы ломаем в первую очередь, чтобы не сломать модель 50M. но он обучался на 100 миллиардах токенов Fineweb-edu байтового уровня, что составляет около 92 миллионов токенов для каждого отдельного параметра (100 миллиардов более 1087). абсурдное соотношение, которое мы специально использовали, чтобы выяснить, что делает модель 1k, когда недостаточная тренировка больше не является оправданием. это завершенный прогон 100B (runs/blink20260621202506, статус: выполнено). Веса здесь — это чемпион турнира по слизнякам, то самое, что было получено в результате слияния. мы не выбрали удачный контрольный пункт и не назвали его моделью. — 1087 параметров, байтовый словарь. кроме весов скачивать нечего. ввод и вывод представляют собой необработанные байты UTF-8. — тусклый=3. три. весь остаточный поток является 3-вектором. — 1 общий трансформаторный блок, зацикленный 2×, с LoRA ранга 2 на цикл и встраиванием на каждую итерацию.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Glint-Research
Теги: mythosmini-blink, tiny-lm, byte-level, looped-transformer, blink, 1k-parameters, en, model-index
Лайков: 6 | Загрузок: 36
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.