Новая модель, обученная новым наборам данных, сохраняя при этом почти идентичную архитектуру предыдущей версии. Единственное различие в архитектуре заключается в том, что длина контекста была увеличена до 1024. — Архитектура: лама — Размер вокаба: 4096 — Скрытый размер: 64 — Слои: 5 — Головы: 8 (MHA) — Длина контекста: до 1024 токенов Несмотря на то, что эта модель исключительно мала для языковой модели, она достигла значительных улучшений в генерации точных и логических предложений по сравнению со своей предшественницей. Эти улучшения стали возможными благодаря изучению сверхпростых историй, созданных более мощными языковыми моделями, вдохновленными бумагой TinyStories. Вместо использования набора данных, переведенного с английских данных, был получен гораздо более качественный набор данных путем создания новых синтетических данных в соответствии с методологией, изложенной в документе. Эта модель была намеренно сохранена в том же размере, что и ее предшественница, чтобы продемонстрировать влияние качества набора данных на производительность модели. На самом деле, несмотря на то, что он обучен только на 10% токенов, используемых в предыдущей модели, он демонстрирует значительно лучшую производительность. Набор данных будет выпущен вместе с более крупной версией…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: north-wind
Теги: llama, ko, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 133
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.