Stockmark-100b — это LLM со 100 миллиардами параметров, предварительно обученный с нуля на основе японского и английского корпуса, состоящего примерно из 910 миллиардов токенов. Эта модель разработана Stockmark Inc. Stockmark-100b был обучен с использованием в общей сложности около 910 миллиардов токенов японского и английского текстового корпуса. Подробные данные по Японии приведены в таблице ниже. Веб-корпус Stockmark состоит из веб-страниц, связанных с бизнесом, которые собираются Stockmark Inc. — Графический процессор: 48 узлов экземпляров a3 (8*H100) — Продолжительность обучения: около 7 недель — Контейнер: контейнер Pytorch NGC — Библиотека: Megatron-LM Набор данных: https://huggingface.co/datasets/stockmark/business-questions Мы исключили категории, требующие расчета и кодирования, и использовали оставшиеся 60 вопросов для оценки. Для локальных LLM мы измерили время вывода с помощью AWS Inferentia2.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: stockmark
Теги: llama, ja, en, text-generation-inference, endpoints_compatible
Лайков: 34 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.