1.5.4 開発について
トークン埋め込み量子化とディスクストリーミングのオプション 量子化精度向上 トランスフォーマー5へのHFトランスフォーマー統合モジュールの更新 包装されたEXL3レイヤのバックプロップを追加 モデルの加載速度向上 性能向上 システムメモリとVRAMオーバーヘッド削減 MiMo-V2.6 の修正 沢山の (潜伏) バグ修正 完全変更日記: v1.5.3...v1.5.4
トークン埋め込み量子化とディスクストリーミングのオプション 量子化精度向上 トランスフォーマー5へのHFトランスフォーマー統合モジュールの更新 包装されたEXL3レイヤのバックプロップを追加 モデルの加載速度向上 性能向上 システムメモリとVRAMオーバーヘッド削減 MiMo-V2.6 の修正 沢山の (潜伏) バグ修正 完全変更日記: v1.5.3...v1.5.4
小型のホイール 実験用nグラムコープス機能 VRAMの最適化により TPモデルによるダイナミック・ドラフト・サイズのサポート その他の修正 完全変更日記: v1.5.2...v1.5.3
MiMoV2ForCausalLM 実験チューリングサポートを追加 臨時VRAMアロケーションのリイン、過度に保守的なウォームアップと自動分割測定パス修正 様々なバグ修正と最適化 完全な変更日記: v1.5.1...v1.5.2
KimiLinearForCausalLMを追加 Qwen3.8-Flash-Next,GLM5.3,DeepseekV3/V4 MoE最適化 Qwen3.8-Flash-Next,GLM5.3,DeepseekV3/V4 TPサポートを追加 分子格子量子化モード 自己校正パイプライン改善 (高度に実験的な YAQAサポートを含む) いくつかのメモリ漏洩を修正 Windows および Conda で EXL3_MOE_PINNED_ARENA の修正 その他の最適化およびバグ修正 完全変更日記: v1.5.0...v1.5.1
NemotronHForCausalLMを修正 (Nemotron-3-Superをサポート) より速い量子化 CPUのオフロードのための実験的なゼロコピーのピンドアリーナモード (Linuxのみ) より速いMoEプリフィールと解読 (下記を参照) MoEモデルのための推測的な解読の改善 いくつかのアーキテクチャでより速い密度のモデルプリフィール いくつかの非決定論のソースを削除 バグ修正とクリーンアップ テストケース 4kプリフィール、t/s解読、t/s,S=1 Qwen3.8-Flas...
DeepseekV4ForCausalLMビジョンタワーを追加 (DeepseekV4-Flash-Vision-Expをサポート) Lfm2ForCausalLMを追加 (LFM2.5密度の多様体) Spark2_5ForCausalLMを追加 (Spark-X2.5) Glm4MoeLiteForCausalLMを追加 (GLM4.7-Flash) より正確なオートスプリット会計 速いCPUオフロード、より良いインテルサポート (AVX512BW層) ビジョンタワーオフロード後にVRAM漏れを修正 大型モデルをオフロードする際に潜在的な労働者のタイムアウトを修正する。..
pyproject.toml を追加 DSv4-Flash,Qwen3.8-Flash-Next,および GLM5.3-Flash のキャッシュ量子化 VRAM 割り当てを最適化し、デフォルトで拡張可能なセグメントに切り替える FA2 コード経路を完全に削除 その他の最適化とバグ修正 完全変更日記: v1.4.7...v1.4.8
すべてのレベルの CPU MoE 性能改善 DRY サンプラーを追加 繰り返されるスロット漏れを修正 6,7 および 8 ビット・トレリーズの量子化が速く 他の多くのバグ修正、最適化およびQoLの改善 フル・チャングログ: v1.4.6...v1.4.7
v1.4.6 からいくつかのリグレーションを修正 Windows のための実験 n-gram ストリーミングを追加します 完全な変更日記: v1.4.5...v1.4.6
サポート Glm5NextForConditionalGeneration (GLM5.3-Flash) サポート Qwen4ExpForConditionalGeneration (Qwen3.8-Flash-Next) 改善された MoE MTP 性能 MoE レイヤのスラブアロケーション 間違ったアライナインされた専門家テンソール形状のために無駄な VRAM を避ける トリトン条件レース (オートチューナー: 'NoneType' オブジェクトはマッピングエラーではありません) を回避する作業 ユニグラムトークナイザーの修正 その他のバグ修正およびQoLの改善 完全な変更日記:...
スプリット MoE CPU-オフロードモードにおける正確性バグの修正 専門家並行モードにおけるより良い MTP サポート ビジョンタワーの量子化への検証とデフォルト ビジョンモデルのオフロードをサポート (システムメモリからのストリーム、パフォーマンスの罰は小さい) 全変更ログ: v1.4.3...v1.4.4
サポート GlmMoeDsaForCauslLM (GLM 5.2,まだ少しWIPである可能性が高い) ダイナミックな配置 (エキスパートキャッシュを置き換える) を有する部分的なCPU層エキスパートオフロードオプション 自動校正された信頼性値でダイナミックなドラフトサイズの改善 新しい (実験的な) 量子最適化パイプライン 発電機のミッドストリームテキストインジェクションをサポートする (推理トークン予算を有効にする) より正確な自動分割割り当て 削減。..
サポート MuseGlimmerForConditionalGeneration 完全な変更日記: v1.4.1...v1.4.2
Mistral-4 を追加 (Mistral3ForConditionalGeneration の下に) ロジットバイアスをサポートする Formatron の代わりに LLGuidance を採用する (依然としてオプション依存としてサポートされる) banned_strings の隣にフィルター/文法を許可する 完全な変更ログ: v1.4.0...v1.4.1
サポート DeepseekV4ForCausalLM AVX512 CPU のオフロード性能が向上した プレフィール速度が速い (すべてのモデル) バグ修正 QoL 機能 完全変更日記: v1.3.0...v1.4.0
DeepseekV3の初期サポート (JoyAI-LLM-FlashとMoonlight-16B-A3Bに対して検証、ルーティンググループはまだない) 2階層CPU K/Vキャッシュ、よりインテリジェントなページとチェックポイント退出ポリシー Freq/rep 修正。XTCサンプラーとトークン禁止の長期文脈の遅延を引き起こす罰 セキュリティーセンサの読み込みの潜在脆弱性を軽減 他のバグ修正、最適化、QoLの改善 Ful...
より速い量子化 Windows: JITコンパイルエラーと壊れた CPUオフロードパフォーマンスの修正 多トークン文字の終わりと始まりの両方のトークンの解読を壊すトークナイザー問題の修正 (韓国語スペシャル) 完全な変更日記: v1.2.0...v1.2.1
LagunaForCausalLM (およびDFlashLagunaForCausalLM) のサポート 専門家層の実験的なCPUオフロードサポート 実験的なダイナミック・ドラフトウィンドウ機能 改善されたセーフェテンサーの読み込み (より速く) より多くのグラフ経路 性能チューニング compare_q.pyを削除し、qbench.pyで置き換えられた 様々なバグ修正 完全変更日記: v1.1.0...v1.2.0
HYV3ForCausalLMをサポートする TPモードのCPUオーバーヘッド削減とネイティブバックエンドのプレフィールパフォーマンスの改善 トーチ。マルチノミアルの暗黙の断片処理動作に一致するようにトップ-P=1サンプリングを調整する 繰り返しモデルでサポートされている禁止文字列 バグ修正とQoLの改善 完全な変更日記: v1.0.0...v1.1.0
-> 図表の小さな書き込み。Flash-attention-2 と xformers の依存関係を削除 オンラインキャッシュの量子化、SWA 層と注意槽の二重入力を持つ新しい注意カーネル 新しい conv1d カーネル (causal_conv1d のサポート/必要性を削除) Ampere の GEMM/GEMV 性能が大幅に改善 ニュー INT8 GEMV カーネル 新しい MoE カーネルチケットスケジューラー すべての attn/GDN モジュールのグラフ経路 融合したサンプリングカーネル。..
TPモードで MTP 作成時のエラーを修正 迅速なクワニゼーション フル チェンジログ: v0.0.42...v0.0.43
MTPモデルがターゲットモデルの出力デバイスにないときに MTP 作成を修正します 完全な変更日記: v0.0.41...v0.0.42
Qwen3.5/3.6 の MTP サポートを追加しました 全変更日記: v0.0.40...v0.0.41
サポート Gemma4UnifiedForConditionalGeneration 完全な変更ログ: v0.0.39...v0.0.40
Step3p7ForConditionalGenerationを追加する 完全な変更ログ: v0.0.38...v0.0.39
Lfm2MoeForCausalLM (LFM 2.5) をサポートする bsz > 1 のとき GDN 推論の回帰を修正 cudaMallocAsync バックエンドが使用されたときに TP モードで DFlash が破損する問題を修正 QoL 改善 全変更日記: v0.0.37...v0.0.38
もう1つの小さなバグ修正 完全な変更ログ: v0.0.36...v0.0.37
小規模なSD回帰を修正 完全な変更ログ: v0.0.35...v0.0.36
Qwen3.5/3.6用のテンサー並行モード 新しいリキュレント状態マネージャー リキュレント状態のダイナミクス割り当てを避ける (断片化を軽減し、Qwen3.5のVRAMオーバーヘッドを恒定に保つなど) 利用可能なキャッシュスペースをよりよく利用するための改善されたチェックポイント決定 大層のスライスで再構築-GEMMを実行し、VRAMオーバーヘッドを大幅に削減する ストリーミングトークン出力を遅らせるレース状態の修正。..
プリフィール中にVRAMの使用を増やすリグレッションを修正 CUDA 13.2.0ホイールを追加 (火花に対してcu132で構築==2.11.0+cu130) 全変更日記: v0.0.33...v0.0.34