Ollama 0.33.1とGLM-5.3対応更新

DAILY NEWS公式情報アップデート

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

2026年8月26日公開のOllama 0.33.1とTransformers 5.16.1を公式releaseで確認し、Qwen3.8 Flash Next、GLM-5.3-Flash、互換性修正の対象と更新判断を整理します。

model対応と互換性修正を対象環境へ結び、更新前の検証へ導く要点図

先に結論

本日の実務的な更新は、Ollama 0.33.1がMLX経路でQwen3.8 Flash Nextとstructured outputを更新したこと、Transformers 5.16.1がGLM-5.3-Flashを追加し、tensor parallel APIの後方互換性とkernel固定を修正したことです。どちらも全modelの速度向上を示すreleaseではありません。対象modelまたはMLX/tensor parallelを使う環境だけ、現行版を残した並行検証へ進みます。

収集日時: 2026年8月28日 06:45(Asia/Tokyo)
対象期間: 2026年8月26日 18:45〜2026年8月28日 06:45
情報区分: 公式repository releaseと、releaseから参照された公式PR・documentationを確認した机上調査です。
検証状況: KFBはOllama 0.33.1、Qwen3.8 Flash Next、Transformers 5.16.1、GLM-5.3-Flashを実機で実行していません。速度、peak memory、model品質、OS別binary、rollout地域、費用は未検証です。

本日の要点

  • Ollama 0.33.1はMLX利用者向けのmodel対応、structured output、低速storageからのload時のMetal timeout回避を更新しました。
  • Transformers 5.16.1はGLM-5.3-Flash対応とtensor parallel互換性修正を含みますが、model cardの性能主張をKFBの比較値には採用しません。
  • 今日の判断は、対象model・runtime・artifact・promptを固定し、旧環境へ戻せる状態で1件ずつ試すことです。

ニュース一覧

1. Ollama 0.33.1がMLXのmodel対応を更新

  • 何が変わったか: Ollamaはv0.33.1を2026年8月26日18:09 UTCに公開しました。公式releaseは、MLXでのQwen3.8 Flash Next対応、MLX/llama.cpp更新、mlxrunnerのstructured output対応、低速storageからのmodel load時にMetal GPU timeoutを避ける修正を列挙しています。
  • 性能・動作環境への影響: 影響範囲は主にMLX/Metal経路です。releaseには同じmodel・Mac・storage・contextで測ったTTFT、decode tok/s、peak unified memoryの値がないため、全Macで速くなるとは判断しません。structured outputもschema追従率や品質を保証する記述ではありません。
  • どの読者・機器に向くか: Apple Silicon MacでOllamaのMLX経路を使い、Qwen3.8 Flash Next、schema出力、低速外部storageからのloadを試す読者が検証対象です。CUDA/ROCmだけを使うserverや、対象変更を使わない安定環境は急いで更新する理由が弱いです。
  • 今日対応すべきか: 現行version、model digest、context、schema、storageを記録し、0.33.1を別環境で1requestだけ確認します。出力形式、load完了、Metal errorの有無を確認できなければ現行版へ戻します。
  • 確認範囲: release本文の変更一覧と公開時刻を確認しました。Qwen3.8 Flash Nextの配布条件、対応quantization、model libraryでの提供時期、macOS最低version、既知のregressionは未確認です。
  • 公式情報: Ollama v0.33.1 release(2026年8月26日公開)

2. Transformers 5.16.1がGLM-5.3-Flashを追加

  • 何が変わったか: Hugging FaceはTransformers v5.16.1を2026年8月26日14:50 UTCに公開しました。GLM-5.3-Flashの実装を追加し、v5.16.0からの小修正としてtensor parallel APIの後方互換性復元と、ESMFold2用kernelのcommit・repository path固定を含めています。
  • 性能・動作環境への影響: 公式releaseはGLM-5.3-Flashを320B total/18B activeのmultimodal modelとして紹介します。ただし掲載された品質・価格・長context効率はmodel開発側の主張で、完全なhardware、runtime、quantization、prompt、token数をこのreleaseだけから固定できません。KFBはrankingや増減率に使いません。
  • どの読者・機器に向くか: GLM-5.3-FlashをTransformersでloadする開発者、5.16.0のtensor parallel API互換性に影響を受けたserver担当者、kernel revisionを固定したい利用者が対象です。GPU台数や必要VRAMはmodel cardと実artifactを別に確認します。
  • 今日対応すべきか: GLM-5.3-Flashが必要なら5.16.1、model repositoryのfull revision、dtype、GPU、tensor parallel設定を一組で固定します。既存modelだけの環境は、5.16.0/5.16.1の差分と依存関係を確認してから更新します。
  • 確認範囲: releaseとGLM実装PRを確認しました。GLM weightのlicense、地域別API提供、実peak VRAM、quantized artifact、production安定性、security修正の影響範囲は未確認です。
  • 公式情報: Transformers v5.16.1 release(2026年8月26日公開)/GLM-5.3-Flash support PR(実装の一次情報)

関連する既存ガイド

Ollamaのstructured outputを試す前に、JSON Schema出力の最短手順で生成と受信後検証を分け、構造化出力の二重検証設計でmodel digest、schema、temperature、streamingを固定してください。0.33.1のmlxrunner対応はschema追従品質の実測を代替しません。

情報の確認範囲

採用した2件は同じ出来事ではなく、OllamaのMLX実行経路とTransformersのmodel実装・互換性修正です。Transformers 5.16.0は同じsourceの直前releaseであり、5.16.1との関係を説明するためだけに確認し、別itemとして数えていません。OpenAIの教育・地域展開とGoogle Searchの旅行機能は、model性能・runtime・機器選択へ直接つながらないため採用していません。

公式情報源