Метка: nemotron_h - Страница 4 - Каталог нейросетей

Метка: nemotron_h

Генерация текста

OpenResearcher/OpenResearcher-30B-A3B

OpenResearcher-30B-A3B — это агентная модель большого языка, предназначенная для глубоких исследований с большим горизонтом, настроенная на основе NVIDIA-Nemotron-3-Nano-30B-A3B-Base-BF16...

Генерация текста

nvidia/NVIDIA-Nemotron-Nano-9B-v2-Japanese

NVIDIA-Nemotron-Nano-9B-v2-японский は、NVIDIAによってスクラッチから学習された大規模言語モデル(LLM )であり、推論タスクと非推論タスクの両方に対応する統合モデルとして設計され、日本語に特化して最適化されています。本モデルは、Nemotron-Personas-Japanデータセットを用いて作成された日本語のВызов инструмента データにより、NVIDIA-Nemotron-Nano-9B-v2を基にさらに追加学習が行われました。本モデルは、ユーザーからの質問やタスクに対して、まず推論トレース(рассуждение трассировка)を生成し、その後に最終回答を提示します。推論機能はシステムプロンプトによって制御可能です。ユーザーが中間的な推論トレースを表示せずに最終回答のみを希望する場合、そのように設定することも可能ですが、推論を要する難易度の高いプロンプトにおいては、精度がわずかに低下する可能性があります。一方で、先に推論トレースを生成させる設定にすると、一般的により高品質な最終回答が得られます。本モデルは、主に Мамба-2 および MLP 層を中心とし、4 層の Внимание層を組み合わせたハイブリッドアーキテクチャを採用していまНемотрон-Hテクニカルレポートをご参照ください。学習には Megatron-LM および NeMo-RL が使用され、さらに Qwenによって改良が加えられています。 NVIDIA-Nemotron-Nano-9B-v2-японскийのリリースブログは以下を参照してください。...

Генерация текста

nvidia/NVIDIA-Nemotron-Nano-9B-v2

NVIDIA-Nemotron-Nano-9B-v2 — это большая языковая модель (LLM), обученная NVIDIA с нуля и разработанная как унифицированная модель как для...