v0.31.0: [Misc] トランスフォーマーバージョンを追加 要求の上限 (#59614)
署名: Isotr0py Isotr0py@outlook.com 共著者: ハリー・メルラー 19981378+hmellor@users.noreply.github.com
署名: Isotr0py Isotr0py@outlook.com 共著者: ハリー・メルラー 19981378+hmellor@users.noreply.github.com
署名: Isotr0py Isotr0py@outlook.com 共著者: ハリー・メルラー 19981378+hmellor@users.noreply.github.com
[Bugfix][HiSparse] MTP受容の崩壊を FULL グラフで修正する。..
ロバート・ショウ robshaw@redhat.com 共同執筆 ロバート・ショウ robshaw@redhat.com 共同執筆 クロード・オプス 5.5 noreply@anthropic.com 共同執筆: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com> 共同執筆:ニック・ヒル nickhill123@gmail.com
リリース vllm-proto 0.4.0
[Bugfix][Mamba] チェックポイントを 薄い。..
署名: クルー クルー000@gmail.com 共同執筆: クロード・オプス 5.5 noreply@anthropic.com
署名: アンドレアス・カラツァス akaratza@amd.com 同著: OpenAI コデックス noreply@openai.com
このリリースには315人の貢献者から762件のコミットメント (104件の新規) が含まれています!新しいモデル: DeepSeek-V4.1-Flash (#56214, #56228, #56208) で、FlashMLA V4.1レコードを介してSM100 (#56893), DeepGEMM Mega-mHC (#56962) でMXFP8にKV全体を格納し、Engram DPシェードリング (#56512) でアシンクエングラムプレフェッチ;DepSeek-V4-Flash-Vision-Exp (#54566),またROCm (#55107) でLoRA (#55897) で。..
[Bugfix][NIXL] 通知のみのリクエストの報告を受信するのを避ける (...
署名: jiahanc 173873397+jiahanc@users.noreply.github.com 共著者: オープンAI コデックス
リリース vllm-proto 0.3.0
PR #56538 CI で fa2a26f で検証されました。
[ウォーターマーク] 二重鍵のガムベル・マックスウォーターマーク 憶測的な解読。..
vllm-proto 0.1.0
このリリースには、277人の貢献者 (91人の新規) から594件のコミットメントがあります!Model Runner V2は、すべてのモデル (#53183) のデフォルトで、モデル (#48290) のプールで始まった展開を完了しました。MRV2はまた、KVキャッシュの自動サイズ化 (#53306),ステップごとにログットのメモリを1/TP (#50465),プロンプト埋め込み (#42963),extract_hidde...でカットするバッチ分割サンプリングのためのCUDAグラフメモリプロファイリングも獲得した。
[Bugfix][Core] ハイブリッドモデル (#55...
[Core] Mamba + E のデフォルトプレフィックス_キャッシュ_レテンション_インターバル
作成者: コデックス codex@openai.com 署名: コデックス codex@openai.com
[CI] 削除されたnvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF1...
[Bugfix][Multimodal] SHMワーカーキャッシュで前項でカバーされた項目を扱う。..
署名: ケヴィン・ルー 51931015+khluu@users.noreply.github.com 署名: ヨーグエ・ジュ・zyy1102000@gmail.com 共同執筆: コデックス・コデックス@openai.com 共同執筆: ヨーグエ・ジュ・zyy1102000@gmail.com
[ツール] [レシピ] スイープの推奨や 短偽の解析を向上させる。..
このリリースには、 270人の貢献者 (76人の新規) から 584 のコミットメントがあります!Kimi-K3のパフォーマンス推進:キミ-K3のスタック全体での主要な最適化努力 ディコードコンテキストパラレル (DCP) サポート (#50484),融合FlashKDAデコードとプリフィールカーネル (#50654, #51311, #52458), MegaMoE (#50510) のSiTUアクティベーションサポート、シーケンスパラレリズム (#52079) のGEMM-RS,すべての収集者を組み合わせた。..
(Cherry picked from commit b389ac2) 署名は: khluu khluu000@gmail.com
[バグ修正][セキュリティ] _load_ov2_プロセッサを _resolve_trust_remotで保護する。..
署名: Lucas Wilkinson lwilkins@redhat.com 署名: Lucas Wilkinson LucasWilkinson@users.noreply.github.com 署名: Benjamin Chislett chislett.ben@gmail.com 署名: Lucas Wilkinson wilkinson.lucas@gmail.com 署名: Nick Hill nickhill123@gmail.com 共著者: OpenAI コデックス codex@openai.com 共著者: Claude Opus 5 (1M文脈) noreply@anthropic.com 共著者。..
これはv0.27.0の上のパッチリリースですサポート量子化DSpark マルコフヘッド (#50424)
vLLM v0.27.0 リリースノート ハイライト このリリースには、242人の貢献者から561件のコミットメント (64件の新規) が含まれています!Kimi K3 サポートは1つのリリースで完全なスタック着陸:コアモデルファイルとカーネル (#50089, #50000),Python (#50093) とRust (#50104) フロントエンド、AttnResカーネル (#50090),DeepGEMMサポート (#50458),圧縮テンサー量子化チェックポイント (#50500),DSpark AR 融合 (#50242),およびオプションt ...
v0.27.0rc2