, —, —, . Вы можете задать ему все, что захотите, и он сделает все возможное, чтобы предоставить вам точную и актуальную информацию. ‘ Quantized_by: TheBloke , —, —, . Вы можете задать ему все, что захотите, и он сделает все возможное, чтобы предоставить вам точную и актуальную информацию. оболочки python3 python -m vllm.entrypoints.api_server —model TheBloke/Uncensored-Frank-33b-AWQ —quantization awq python from vllm import LLM, SamplingParams подсказки = [ «Здравствуйте, меня зовут», «Президент Соединенных Штатов», «Столица Франции», «Будущее ИИ», ] sampleparams = SamplingParams(temperature=0.8, topp=0.95) llm = LLM(model=»TheBloke/Uncensored-Frank-33b-AWQ», quantization=»awq») для вывода в выходных данных: Prompt = output.prompt сгенерированный текст = вывод.outputs[0].text print(f»Prompt: {prompt!r}, Сгенерированный текст: {generatedtext!r}») оболочки pip3 install autoawq оболочка pip3 uninstall -y autoawq git clone https://github.com/casper-hansen/AutoAWQ cd AutoAWQ pip3 install . python из awq импорт AutoAWQForCausalLM из трансформаторов импорт AutoTokenizer model = AutoAWQForCausalLM.fromquantized(имямоделиилипуть, плавкие слои=True,trustremotecode=False,safetensors=True) tokenizer =…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: llama, en, text-generation-inference, 4-bit, awq
Лайков: 7 | Загрузок: 8
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.