Терминатор — это легкий нейронный модуль, который предсказывает, когда модель языка рассуждений достигнет окончательного ответа во время генерации цепочки мыслей (CoT). Когда Терминатор обнаруживает, что модель готова дать ответ, он отсекает оставшиеся рассуждения и заставляет модель начать ответ, тем самым предоставляя тот же ответ со значительно меньшими затратами вычислений. Этот репозиторий содержит все необходимое для запуска Terminator-Qwen3-8B: — Обученная контрольная точка Терминатора (1 дополнительный слой преобразователя + голова прогнозирования) — Код плагина vLLM (vllmterminator/`) для высокопроизводительного обслуживания — Средство запуска сервера и клиент потоковой передачи — Автономный сценарий вывода HuggingFace (сервер не требуется) — Сценарий автоматической настройки — Графический процессор: один графический процессор NVIDIA с не менее ~ 24 ГБ видеопамяти — CUDA: установлен совместимый драйвер CUDA, Рекомендуется 12.9 и выше. — Python: 3.12 — ОС: Linux (рекомендуется) или любая ОС, поддерживаемая vLLM. Сервер совместим с OpenAI. Вы можете использовать любую клиентскую библиотеку OpenAI. Замените localhost на адрес вашего сервера при удаленном подключении: этот проект основан на Qwen3-8B команды Qwen. Условия использования базовой модели см. в лицензии Qwen3.
Модальности:
Генерация текста
Области применения:
Логика и рассуждение
Задача: Генерация текста
Автор: acnagle
Теги: vllm, qwen3, reasoning, chain-of-thought, efficiency, inference-optimization, en
Лайков: 5 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.