Jalapeño推論性能とllama.cpp 0.3.0
DAILY NEWS公式情報アップデート
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
2026年8月25日の公式更新から、JalapeñoのGPT-OSS 120B推論測定とllama.cpp 0.3.0のモデル・Metal・分散実行変更を、条件、機器への影響、今日の判断に分けて整理します。

先に結論
本日の選択を変えるのは、OpenAIがJalapeñoの推論性能を公開条件付きで示したことと、llama.cpp 0.3.0が新しいmodel対応・分散実行・Metal実装をまとめて更新したことです。Jalapeñoの値は購入可能な単体GPUの一般比較ではなく、OpenAIのrack-scale systemとGB200/GB300をInferenceXの条件内で比べた開発元測定です。llama.cppはDeepSeek 4、GLM-4.5-Air、dots3-noteを使う読者だけ更新候補にし、既存modelだけの環境はrelease noteと互換性を確認してから進めます。
収集日時: 2026年8月26日 05:30(Asia/Tokyo)
対象期間: 2026年8月24日 17:30〜2026年8月26日 05:30
情報区分: 開発元の発表本文と公式repository releaseを個別に確認した机上調査です。
検証状況: KFBはJalapeño、GB200/GB300、llama.cpp 0.3.0を実機で実行していません。価格、提供地域、導入時期、別model・別contextでの性能、各OSのbinary動作は未確認です。
本日の要点
- Jalapeñoの公開値はGPT-OSS 120Bなど3 model、nominal 8K input/1K output、InferenceXの同一項目で読むと有用です。
- llama.cpp 0.3.0はDeepSeek 4のtensor split、GLM-4.5-AirのMTP、Metal kernel再編を含みますが、全modelの一律高速化を意味しません。
- 今日の判断は、対象modelとbackendが一致する環境だけ検証用に更新し、速度・電力・安定性を自分の機器へ転用しないことです。
ニュース一覧
1. JalapeñoがGPT-OSS 120Bの推論性能を公開
- 何が変わったか: OpenAIはcustom inference chip「Jalapeño」の最初の測定結果を公開しました。InferenceXでGPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1Tを評価し、比較systemより高いthroughput per kWと低いend-to-end latencyを両立したと報告しています。
- 性能・動作環境への影響: GPT-OSS 120Bのappendixはnominal 8K input/1K output、STP、package TDPをJalapeño 700W、GB200 1,200Wとして、peak mixed TPS/kWを約1.9倍、end-to-end latencyを約1.7分の1としています。Jalapeñoの実測継続電力は対象workloadで550W以下だった一方、比較正規化には各acceleratorの公称chip powerが使われています。これはOpenAIによる開発元測定で、KFB実測や独立測定ではありません。
- どの読者・機器に向くか: 大規模modelをrack scaleでserveし、latencyだけでなくthroughput per kWも調達判断に使うplatform担当者向けです。手元のMac、consumer GPU、単一H100の買い替え判断へ直接当てはめられる結果ではありません。
- 今日対応すべきか: 一般読者は様子見です。推論基盤の選定担当者は、同じmodel、8K/1K、STP、power正規化で比較できる資料として保存し、提供条件と外部再測定を待ちます。
- 確認範囲: 発表本文とappendixの条件・数値は確認しました。Jalapeñoの販売形態、価格、region、rack構成、software stack、第三者による再現、長時間運用時の電力は未確認です。
- 公式情報: OpenAIの発表(2026年8月25日公開)
2. llama.cpp 0.3.0が新modelと分散実行を更新
- 何が変わったか: llama.cpp 0.3.0はdots3-noteと新しいDSA-ISWA KV cache、GLM-4.5-AirのMTP、DeepSeek 4の
-sm tensorとmulti-sequence rollback修正を追加しました。内部のggmlは0.22.0へ上がり、Metal kernelのper-op化とparallel compilationも含みます。 - 性能・動作環境への影響: 直接影響するのはdots3-noteのvision/audio、GLM-4.5-Airのdraft MTP、DeepSeek 4のtensor split、Metalを使うbuildです。releaseは全model共通のdecode tok/s、TTFT、peak memory、消費電力を示していないため、「0.3.0で一律に速くなる」とは判断できません。
- どの読者・機器に向くか: DeepSeek 4を複数backendへ分割するGPU環境、GLM-4.5-AirのMTPを試す環境、Apple SiliconでMetal build時間やkernel変更の影響を追う読者が検証対象です。既存modelを安定運用している環境は緊急更新の対象ではありません。
- 今日対応すべきか: 対象modelを使う場合だけ、現行binaryと0.3.0を同じGGUF、context、batch、backendで並行検証します。
-sm tensorを既存のsplit設定へ無検証で置き換えず、rollback修正もmulti-sequence workloadで確認してから昇格します。 - 確認範囲: release本文、対象version、主要PR項目は確認しました。各platformのprebuilt binary、modelごとの互換性、既知のregression、速度・memory差は実機未確認です。
- 公式情報: llama.cpp 0.3.0 release(2026年8月25日公開)
情報の確認範囲
数値は発表元が示したmodel、input/output長、TDP正規化、比較systemの範囲に限定しました。Jalapeñoの測定をconsumer機器へ、llama.cppの実装変更を未測定の速度向上へ一般化していません。いずれも実機検証前のため、費用、地域差、提供時期、driver、OS、量子化、長時間安定性は採用時に再確認が必要です。
公式情報源
- Jalapeñoの最初の推論測定(2026年8月25日公開、2026年8月26日確認)
- llama.cpp 0.3.0 release(2026年8月25日公開、2026年8月26日確認)


