syzymon/long_llama_code_7b_instruct - Каталог нейросетей
Генерация текста

syzymon/long_llama_code_7b_instruct

Добавлено:
syzymon/long_llama_code_7b_instruct

LongLLaMA-Code 7B Instruct — это LongLLaMA-Code 7B, настроенный на наборы данных, обработанные TIGER-Lab/MathInstruct, OpenOrca и ShareGPT. Он может ответить на основные вопросы об исследовательских работах и ​​коде. Он также может выполнить простой рефакторинг кода. Вы можете попробовать квантованную версию модели, используя бесплатный графический процессор в Google Colab. Модель была настроена на модуле TPU v3-128 с размером пакета 128. Для настройки мы использовали конвейер подготовки данных, доступный в инструкцииfinetuning. Однако мы заменили Тренажер Hugging Face Trainer модификацией кода продолжения предварительного обучения FoT. Эта модификация сводится к распространению кэша памяти по всей модели (по сути, воспроизводит функциональность кода вывода Pytorch в JAX). Здесь мы представляем основную информацию о том, как настраивалась модель. Более подробную информацию можно найти в репозитории GitHub. Все входные данные были усечены и случайным образом дополнены (слева/справа) до 3072 токенов. Последняя длина контекста была установлена ​​равной 1536. Модель обучалась на протяжении 9 тыс. шагов, начиналась со скоростью обучения 1,2e-5, 700 шагов прогрева и заканчивалась скоростью обучения 0. Оптимизатор был adamw. 0.71 – TIGER-Lab/MathInstruct 0.16 – Вопросы Open-Orca/OpenOrca с количеством ответов менее 5 тысяч…

Модальности:
Генерация текста

Области применения:
Следование инструкциям


Задача: Генерация текста
Автор: syzymon
Теги: longllama, custom_code
Лайков: 10  |  Загрузок: 14

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.