Мы представляем rnj-1.5-instruct, продолжение rnj-1-instruct с длинным контекстом, которое расширяет контекстное окно с 32 КБ до 160 КБ. Более подробную информацию о семействе Rnj-1 и rnj-1-instruct, в частности, можно найти на этой странице и в нашем блоге. rnj-1.5-instruct расширяет возможности длинного контекста rnj-1 за пределы 32 КБ, набирая 77% на RULER в окне контекста 128 КБ. Этот выпуск также предлагает более широкие возможности кодирования для более широкого спектра жгутов. Мы улучшаем производительность, проверенную SWE-Bench, на мини-агенте SWE на 5 % и значительно превосходим результаты самой известной модели 8B на связке SWE-Agent, достигая коэффициента разрешения 40 %. Улучшения в rnj-1.5 возникают в результате нашей работы в нескольких ключевых областях: 1. Архитектура. Чтобы облегчить логические выводы о затратах на вычисления и хранение, которые растут с длиной последовательности для глобального самообслуживания, мы исследуем блочно-локальные уровни внимания [5, 6], которые несут фиксированные затраты на вычисления и хранение на каждую позицию. Следуя [4], мы чередуем блочно-локальное самовнимание с глобальным вниманием, сохраняя слои преимущественно локальными и несколько глобальных слоев для усиления ассоциативных взаимодействий на больших расстояниях. После тщательной абляции мы обнаружили локально-глобальный слой…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: EssentialAI
Теги: gemma3_text, conversational, code, text-generation-inference, endpoints_compatible
Лайков: 10 | Загрузок: 342
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.