Unsloth、内蔵ブラウザーとEmbeddingGemma 2対応を追加

スペック

総パラメータ740M(テキスト専用版は270M)
コンテキスト長8K
配布形式・量子化GGUF、safetensors
4bit量子化の目安メモリ約0.4GB(16GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Unslothは新リリースで、チャット横に開く内蔵ブラウザー、Google DeepMindの740Mパラメータのマルチモーダル埋め込みモデルEmbeddingGemma 2への対応、70以上のGGUFモデルを使う音声ページ、低メモリ学習を追加しました。UnslothはAIモデルの実行と学習のためのツール群で、ローカルモデルをコーディングエージェントにも接続できます。

内蔵ブラウザーとサンドボックス

Unslothは、添付ファイル、Webページ、モデルが生成したHTMLをチャット横のタブで開くブラウザーパネルを搭載しました。PDF、Office、HTML、Markdown、コード、テキストに対応し、アドレスバー、検索、ページ内検索、ズーム、ブックマーク、履歴、ダウンロードを備えます。モデルが書いたHTMLやコードはプレビュー、コンソール、Request edits付きのタブで開き、Canvasを置き換えます。ページの一部を選択してモデルに質問できます。WebページはUnslothアカウント、チャット、APIにアクセスできません。Settings > Browserで検索エンジン、既定ズーム、Chrome・Safari・Firefox・Edgeからのブックマークインポートを設定できます。

PythonとTerminalツールでモデルが実行するコードはサンドボックス内で動きます。OSサンドボックスはLinuxとmacOSに対応し、Windows 11はオプトインのプレビューです。ColabとDockerでも動作します。Settings > SandboxではHigh(デフォルト、OSサンドボックス)とLow(ソフトウェアチェックのみ)を選べます。

EmbeddingGemma 2

EmbeddingGemma 2はテキスト、コード、画像、動画、音声をベクトル化し、検索、RAG、分類、クラスタリングに使えます。総パラメータは740M、テキスト専用版は270Mで、ビジョンと音声のエンコーダーはオプションです。100以上の言語と8Kのコンテキストに対応し、MTEB codeでは78.68と、EmbeddingGemma 1の68.76から約14%向上しました。

試し方

  • GGUFまたはsafetensorsをUnslothへインポートして実行するか、テキスト埋め込みをllama.cppで提供します
  • テキストモデルはFastSentenceTransformerで4-bit QLoRAまたはBF16 LoRAによりファインチューニングできます
  • EmbeddingGemmaとQwen3-Embeddingのファインチューン結果は、組み込みのquery・documentプロンプトを保存するようになりました
  • unsloth start --appで、Codex、OpenCode、OpenClaw、Hermesのデスクトップアプリがローカルモデルを使えます
  • 複数モデルの同時ロードはSettings > Resourcesで有効化します(既定はオフ)。vLLMとSGLangはLinux上のNVIDIA GPU向けのオプトイン実験的エンジンです

音声機能

音声ページはSpeak、Clone、Music、Transcribe、Edit、Separate、Convertで構成されます。短いサンプルからの音声クローンと保存、話者の声を保ったままの録音内の語句編集、ボーカル・ドラムなどへの音源分離、音声変換、楽曲・効果音の生成と部分編集、タイムスタンプと話者付き文字起こしおよび字幕出力ができます。

学習と速度の改善

項目 内容
レイヤーオフロード(offload_layers) 凍結レイヤーをシステムRAMに保持し、Llama-3.1-8B 4-bitをVRAM 7 GiB以内で学習。オプトイン、LoRA、NVIDIA・AMD
flash-attnなしのpadding-free学習 Qwen3-0.6BのVRAMが5.45 GBから1.87 GBに減少、ステップは5〜8倍高速
gpt-oss-20b QLoRA NVIDIAで2〜3倍高速
Z-Image-Turbo 旧世代GPUで最大20倍高速
Qwen3.6-35B-A3B(MLX) 応答が約10%高速、長いプロンプトの開始が最大10%早い
Int8 Prefill(M5、MLX) 長いプロンプトの読み込みが最大1.5倍高速、精度はわずかに低下。実験的・オプトイン

このほか、NVIDIA環境での画像・動画生成のライブプレビュー、Ryzen AI NPU向けのファインチューン済みモデル出力、API・MLXチャットでのAuto-compact、Cursor・Claude Code・Codexのチャットインポートも加わりました。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内