Эта модель является предварительно обученной моделью на основе. Основанный хорошо запоминает информацию, представленную в контексте, несмотря на использование фиксированного объема памяти во время вывода. В качестве эталона качества мы включаем предварительно обученную модель внимания (архитектура Llama), представленную здесь: https://huggingface.co/hazyresearch/attn-1b, и модель Mamba, представленную здесь: https://huggingface.co/hazyresearch/mamba-1b. Все три контрольные точки предварительно обучены на 10Bn токенах стопки в точно таком же порядке данных с использованием прогнозирования следующего токена. Реализация модели и обучающий код, создавший модель, представлены здесь: https://github.com/HazyResearch/based. Цель этой работы — оценить качество языкового моделирования новой эффективной архитектуры Based. Мы включили ряд тестов, которые вы можете использовать для оценки качества: — FDA: https://huggingface.co/datasets/hazyresearch/based-fda — SWDE: https://huggingface.co/datasets/hazyresearch/based-swde — SQUAD: https://huggingface.co/datasets/hazyresearch/based-squad Пожалуйста, свяжитесь с simarora@stanford.edu, eyuboglu@stanford.edu и mzhang20@stanford.edu с вопросами.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: hazyresearch
Теги: gpt2, en, text-generation-inference, endpoints_compatible
Лайков: 8 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.