Meta-Llama-3-70B-Instruct quantized to FP8 weights and activations using per-tensor quantization, ready for inference with vLLM >= 0.5.0. This model checkpoint also includes per-tensor scales for FP8 quantized KV Cache, accessed through the —kv-cache-dtype fp8 argument in vLLM. Produced using AutoFP8 with calibration samples from ultrachat. Model evaluation results obtained via lm-evaluation-harness.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: RedHatAI
Теги: llama, fp8, vllm, conversational, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 41
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.