v0.40
変更されたモデルは、このリリースでは、Apple Silicon デバイスでは、MLX ランタイムがサポートするモデルアーキテクチャが自動的に MLX で実行されます。ollama pull qwen3.8 ollama run qwen3.8 プレリリースの間、追加モデルをテストし、有効にする予定です。全変更ログ: v0.34.4...v0.40.0-rc0
変更されたモデルは、このリリースでは、Apple Silicon デバイスでは、MLX ランタイムがサポートするモデルアーキテクチャが自動的に MLX で実行されます。ollama pull qwen3.8 ollama run qwen3.8 プレリリースの間、追加モデルをテストし、有効にする予定です。全変更ログ: v0.34.4...v0.40.0-rc0
mlx:マッチパブリッシャートークナイザーセマンティクス オーナープレトークナイザーステージ順序、分割行動、ユニコード境界、追加トークン標準化、ランクされたBPE合併。追加したトークンとメタスペースの入力を一貫して処理します共有された Go/Python リファレンスケースを追加し 公開されたトークナイザーを使用して 欠落したモデルを直接抽出し エラーを回避します
/v1/systemoneで Cloudflare の新しいオープンソースの意思決定モデルである Clef と Clef Flash をサポートしています。クレフ (27B) とクレフフラッシュ (9B) はマルチモダルのもので、要求はテキスト状態とともに画像を含み、すべての質問で共有され、一緒にスコアされます。curl http://localhost:11434/v1/systemone -d '{ "model": "key-flash", "state": "このスクリーンショットを撮影した"...
ci: 欠落したビルドコンテキスト (#18742) を修正
モデル:キーサポートを追加 (#18741)
Ollama は TypeSafe の Jev API をベースに /v1/systemone を通して意思決定モデルをサポートしています。決定モデルではテキストではなく 選択、確率、スコアが返されますチケットの分類、モデルのルーティング、コンテンツの分類などのタスクに使用します入手可能なモデル:Bespoke Labs Tev1 からNimble からTogether AI ollama 引く アイムブル 文脈と1つ以上の質問を送信: curl http://...
要求を作成するために Modelfiles に CAPABILITY 宣言と additive capabilities フィールドを追加します。GGUFやセーフテンサーの宣言を作成、継承、モデルファイルの輸出を保存する。Qwen アーキテクチャ/レンダリング メタデータとのマッチングの代わりに、System Oneのリクエストをスケジュールする前に意思決定能力を要求する。メインの GGUFのみのスコア制限を 保持する MLX ランタイムワークが 離れるまで。..
監視犬が中断させよう (#1...
feat: System One のスコアリング API (#18606) を追加する
マニフェストリストのストレージを追加して、ランナー特有のマニフェストが1つのタグの下で共存し、既存のv1タグをベスト・エフフォア・ダウングレードアンカーとして保存できます。ランナーとダイジェストの選択を理解し、 参照された子マニフェストとレイヤーを転送します。ローカルコンパティビリティの移行を LAMA.cpp対応の子供に追加します
思考モデルの構造化出力が 単行本で適用され 速く信頼性が向上しました大規模なローカルライブラリで断続的な"モデルが見つかりませんでした"エラーが修正されました。 ChatGPT またはCodex が実行されているかどうかを確認するときに macOS アプリが応答しない状態が修正されました。QWEN 3.8のインプット処理は Apple Siliconでより速くなりますジェマ4はアップル・シリコンで 最高の画像解像度を選びます
文字列や短い配列のスケーマ修正を 検出します
mlx: Qwen 3.8のプロンプト処理を加速する MLXのゲートデルタカーネルを長距離スキャンやSwiGLUに密度の高いMLPグローバルスケールを折りたたむために使用する。コメント
変更点 GET /api/show は、現在各モデルの思考制御とデフォルトを広告しています: CLI で利用できます: ollama show gemma4 思考レベル false, true デフォルト true API で利用できます: curl http://localhost:11434/api/show -d '{"model": "glm-5.3-flash:cloud"}' { "thinking": { "values": ["low", "high", "max"], "default": "max" } また ollama.com でクラウドモードで直接利用できます。..
サーバー: リスト内のホスト間のレジストリクロスホストリダイレクトを許可 (...
api:モデル思考レベルとデフォルトを暴露する (#18473)
Ollama を実行するときに最初の実行設定を追加し、ローカルでサインインまたは継続するオプションが追加されました。MacOS と Windows のデスクトップ アプリで共有されます。ollama://apps を追加して、macOS と Windows で直接デスクトップアプリの Apps ページを開きます。MLXの推測解読で 長世代間の記憶力の過剰な増加を修正した更新された llama.cpp.全変更ログ: v0.34.1...v0.34.2
cli: デスクトップアプリ (#18495) と共有された最初の実行オンボードを追加
解読ループは MLXの解放されたバッファを 256個のトークンごとに解放します これはKVキャッシュが以前より小さいバッファを 増やして落とす頻度ですチェックは、トークン数が 256 の倍数に 準拠するときにのみ発射されます。投機的な解読はラウンド毎に複数のトークンを放出するので ほとんどのラウンドが境界を越えてプールが解放されない。長い文脈で成長する葉は。..
ランナーとアーキテクチャとの間の契約、開いたチェックポイント、チェックポイントテンソールからNN層を構築する。ファイルには どちらがどっちか書かれていなかったbase.go は、折りたたまれたパッケージの名前をインターフェースとレジストリに、root.go は、root の隣に、safetensors ヘッダのスキャンを、そして quant.go は nvfp4 のグローバルスケールヘルパーと quant p を混ぜました。
llama.cppビルド変更により libllama と libmtmd の間に重複したシンボルが生じた。このパッチをリブラマに移動し、出荷したシンボルを表示します。
MLXのセーフティセンサは 実験用ではないGGUFモデルの作成には、Safetensor変換と量子化のために llama.cpp ツールを使用する必要があります。Apple Silicon Runaway の重複トークン検出における MLX メモリー処理の改善により、誤陽性値 (例えば、OCR) /api/tags は大きなモデルライブラリではるかに速く (3.1 s → 294 ms 冷たいテスト),...
typical_p パラメータで新しいモデルを作成するためのサポートを削除し、設定で既存の GGUF モデルをサポートします。
mlx: docker ビルド コンテキストに mlx パッチを追加 (#18440)
MLX: バージョンバム mlx: サポート ModelOpt MoE モデルのグローバルスケール アドレス コメント アドレス コメント
Ollama モデルを ChatGPT デスクトップで直接使用できますので、オープンなモデルを実行している間に既存のワークフローを維持できます。MacOS の Ollama アプリからインストールできます。このリリースでは、Apple Siliconの構造化出力性能も向上し、OpenAI対応のクライアントツール検索とレスポンスコンパクトのサポートも追加されています。完全な変更ログ: v0.33.3...v0.34.0
openai: スタンドアロン名前の関数出力 (#18348) をサポートする
proxy: Full Access (#18331) で名前空間のコマンドを正規化する
openai: plaintextでラベルされたCodexエージェントメッセージ (#18329) を受け入れる
openai: Web 検索の制限 (#18328) で回答を完了する