justinjja/Qwen3-235B-A22B-INT4-W4A16 - Каталог нейросетей
Генерация текста

justinjja/Qwen3-235B-A22B-INT4-W4A16

Добавлено:
justinjja/Qwen3-235B-A22B-INT4-W4A16

Описание: Этот репозиторий содержит модель Qwen 3 235B A22B, квантованную JustinJJA до INT4/W4A16, что значительно уменьшает объем памяти при сохранении точности. Вывод: используйте vllm>=0.8.5 -tp 4 max, используйте -tp 4 -pp 2 для 8 графических процессоров. Код квантования можно найти здесь: https://huggingface.co/justinjja/Qwen3-235B-A22B-INT4-W4A16/blob/main/quantization_script.py userinput2 = «Тогда сколько r в чернике? /nothink» print(f»User: {userinput2}») response2 =chatbot.generateresponse(userinput2) print(f»Bot: {response2}») print(«———————-«) userinput3 = «Правда? /think» print(f»User: {userinput3}») response3 =chatbot.generateresponse(userinput3) print(f»Bot: {response3}») python from qwenagent.agents import Assistant ‘modelserver’: ‘http://localhost:8000/v1’, # apibase ‘api_key’: ‘EMPTY’, Tools = [ {‘mcpServers’: { # Вы можете указать файл конфигурации MCP ‘time’: { ‘command’: ‘uvx’, ‘args’: [‘mcp-server-time’, ‘—local-timezone=Asia/Shanghai’] }, «fetch»: { «command»: «uvx», «args»: [«mcp-server-fetch»] } } }, ‘code_interpreter’, # Встроенные инструменты ] messages = [{‘role’: ‘user’, ‘content’: ‘https://qwenlm.github.io/blog/ Представляем последнюю версию разработки…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: justinjja
Теги: qwen3_moe, conversational, endpoints_compatible, compressed-tensors
Лайков: 10  |  Загрузок: 50

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.