В этом репозитории представлены большие языковые модели, разработанные LLM-jp — совместным проектом, запущенным в Японии. — факел>=2.3.0 — трансформаторы>=4.40.1 — токенизаторы>=0.19.1 — ускорение>=0.29.3 — flash-attn>=2.5.8 — Тип модели: языковая модель на основе трансформатора — Всего просмотренных токенов: 256B — Предварительное обучение: — Аппаратное обеспечение: 128 графических процессоров A100 40 ГБ (кластер mdx) — Программное обеспечение: Megatron-LM — Настройка инструкций: — Аппаратное обеспечение: 8 графических процессоров A100 40 ГБ (кластер mdx) — Программное обеспечение: TRL и DeepSpeed Токенизатор этой модели основан на модели резервного байта Huggingface/tokenizers Unigram. Словарные статьи были преобразованы из llm-jp-tokenizer v2.2 (100k: code20Ken40Kja60K.ver2.2). Пожалуйста, обратитесь к README.md llm-ja-tokenizer для получения подробной информации о процедуре создания словаря (чистое обучение SentencePiece не воспроизводит наш словарь). — Модель: быстрый токенизатор Hugging Face с использованием байтовой резервной модели Unigram. — Алгоритм обучения: код маржа/английский/японский словари, созданные с помощью байтового резервного варианта SentencePiece Unigram и повторная оценка оценок с помощью EM-алгоритма. — Данные обучения: подмножество наборов данных для предварительного обучения модели. — Размер словарного запаса: 96 867 (смешанный словарь японского, английского и…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: llm-jp
Теги: llama, en, ja, text-generation-inference
Лайков: 15 | Загрузок: 32
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.