Доработанная модель Qwen3-0.6B для преобразования вопросов на естественном языке в запросы SQL. Эта компактная модель параметров размером 0,6 байта, обученная с использованием знаний DeepSeek-V3, обеспечивает высокую производительность Text2SQL, будучи при этом чрезвычайно легкой и быстрой для локального развертывания. Точно настроенная модель достигает 74% точности LLM-as-a-Judge всего лишь с параметрами 0,6B, что в 2 раза лучше базовой модели и приближается к производительности преподавателя параметров 685B при незначительном уменьшении размера. Для локального вывода используйте квантованную версию GGUF, включенную в этот репозиторий: 1. Исходные данные: 50 проверенных вручную примеров Text2SQL, охватывающих различные сложности SQL. 2. Синтетическая генерация: расширена до ~ 10 000 примеров с помощью DeepSeek-V3. 3. Точная настройка: 4 эпохи в синтетическом наборе данных. 4. Оценка: LLM-as-a-Judge с проверкой семантической эквивалентности — Эпохи: 4 — Скорость обучения: 5e-5 (косинусный график) — Размер пакета: 1 (с накоплением градиента) — Всего шагов: ~40 000 Один SQL-запрос с: — Ключевые слова SQL в верхнем регистре (SELECT, FROM, WHERE и т. д.) — Синтаксис, совместимый с SQLite — Никаких объяснений или дополнительного текста — Простой: SELECT, WHERE, COUNT, SUM, AVG, MAX, MIN — Средний: JOIN, ГРУППИРОВАТЬ, ИМЕТЬ, Упорядочивать,…
Модальности:
Генерация текста
Области применения:
Текст в SQL Диалог / чат
Языки программирования:
SQL
Задача: Генерация текста
Автор: distil-labs
Теги: qwen3, text2sql, sql, nlp, distillation, conversational, en, text-generation-inference
Лайков: 7 | Загрузок: 50
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.