replit-code-v1-3b — это каузальная языковая модель 2.7B, ориентированная на завершение кода. Модель была обучена на подмножестве набора данных Stack Dedup v1.2. Учебная смесь включает в себя 20 различных языков, перечисленных здесь в порядке убывания количества токенов: Markdown, Java, JavaScript, Python, TypeScript, PHP, SQL, JSX, reStructuredText, Rust, C, CSS, Go, C , HTML, Vue, Ruby, Jupyter Notebook, R, Shell В общей сложности обучающий набор данных содержит 175B токенов, которые были повторены в течение 3 эпох — всего, replit-code-v1-3b был обучен на 525B токенах (~195 токенов на параметр). Модель была обучена на платформе MosaicML с 256 графическими процессорами A100-40 ГБ, используя их последние примеры LLM. replit-code-v1-3b основан на самых современных методах LLM, таких как: Flash Attention для быстрого обучения и вывода, позиционные вложения AliBi для поддержки переменной длины контекста во время вывода, оптимизатор LionW и т. д. Replit предполагает, что эта модель будет использоваться кем угодно в качестве основополагающей модели для тонкой настройки для конкретного приложения без строгих ограничений на коммерческое использование. Набор данных для предварительной подготовки мог содержать оскорбительный или неприемлемый контент даже после применения данных…
Модальности:
Генерация текста
Области применения:
Генерация кода
Задача: Генерация текста
Автор: lentan
Теги: tensorboard, replit_lm, code, custom_code, model-index
Лайков: 3 | Загрузок: 36
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.