GLM-5.3-FlashのGPU・API選び
GLM-5.3-Flashの320B総parameter・18B active、FP8/BF16、Transformers 5.16.1・vLLM・SGLang対応を確認し、複数GPUとAPIの分岐を判断します。
CATEGORY
入門の導入、設定、活用方法を実例とともに解説する記事一覧です。 全30件。
GLM-5.3-Flashの320B総parameter・18B active、FP8/BF16、Transformers 5.16.1・vLLM・SGLang対応を確認し、複数GPUとAPIの分岐を判断します。
Qwen3 4B・8B・30B-A3Bを公式品質表、32Kネイティブ/YaRN拡張context、量子化artifact容量から比較し、8GB GPU、16GB Mac、24GB GPU、H100で候補にできる範囲を判断します。
Llama 4 ScoutとMaverickを、正確なmodel ID、109B/400B total、10M/1M context、Int4/BF16/FP8、H100構成、画像入力、Community Licenseから選ぶ実用ガイドです。
Mistral Small 4のAPI、BF16、NVFP4、EAGLEを、119B、256K context、公式artifact容量、H100/H200/B200要件から選ぶ実用ガイドです。未測定の速度とpeak memoryも分けます。
Gemma 3n E2B ITとE4B ITを、2GB/3GBの公式memory目安、32K context、画像・音声入力、Google公表品質から選ぶガイドです。速度未測定の範囲も分けて判断できます。
gpt-oss-20bと120bを、16GB memory、Apple Silicon、H100 80GB、Windowsで選ぶガイドです。MXFP4の公式容量目安、128K context、現行runtime、未測定範囲を分けて判断できます。
Nemotron 3 Nano 30B-A3BのBF16・FP8、gpt-oss-20b、Qwen3-30B-A3Bを、NVIDIA公表の単一H200・8K入力・16K出力へ限定して読み、H200、H100、NIMで候補を選ぶ方法を解説します。
Gemma 4 12Bと26B-A4Bを、32GB Mac、24GB GPU、H100 80GBで選ぶ実用ガイドです。公式memory表、現行revision、対応runtime、未実測範囲を分けて判断できます。
TensorRT-LLMの量子化を初めて学ぶ人向けに、weight・activation・KV cacheの違い、対応GPUとcheckpointの確認、公式LLM APIで読み込む最短手順、失敗時の戻し方を整理します。
Hugging Face Hubからmodel snapshotをfull commit hashで取得し、保存先とrevisionを確認して、ネットワークなしの読み込みまで試す最短手順を初心者向けに解説します。
OllamaのModelfileにベースモデル、system指示、生成parameterを記録し、ollama createとrunで同じ定義を呼び戻す手順を初心者向けに説明します。失敗時の切り分けと、タグだけに頼らない確認方法も整理します。
OpenAI公式SDKでResponses APIを1回呼び、output_textとresponse.idを確認して2回目へ引き継ぐ最短手順を解説します。API keyの扱い、成功確認、失敗時の戻し方、未実行の範囲も明記します。
llama.cpp b10447でHugging Faceの対応モデルを高精度GGUFへ変換し、Q4_K_Mへ量子化して読み込みを確認する手順を解説します。必要なRAM・disk、再量子化を避ける理由、未実行の検証範囲も明記します。
Transformers v5.15.0で小型GGUFをtokenizerとmodelへ読み込み、最初の生成を確認します。逆量子化後のmemory、失敗時の切り分け、元へ戻す方法まで解説します。
vLLM v0.26.0で互換LoRA adapterを起動時に固定読込し、モデル一覧と同じAPIからbase/LoRAを切り替える最短手順、成功確認、失敗時の戻し方を解説します。
llama.cpp b10328を基準に、追加model不要のn-gram方式をbaselineから有効化し、応答完了、draft token、acceptanceを確認して元へ戻す最短手順を説明します。
Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。
Ollamaの埋め込みを初めて使う人向けに、同じmodelで文書と質問をvector化し、件数・次元・単位長を確認して、cosine similarityで最も近い短文を選ぶ最短手順と戻し方を解説します。
TensorRT engine backend削除後のTensorRT-LLMを初めて扱う人向けに、対応環境の確認、checkpointからtrtllm-serveを起動する最短手順、成功確認、失敗時の戻し方を解説します。
Apple Silicon MacでMLX LMの共通promptをcache fileへ保存し、別の質問で再利用する手順を解説します。確認方法、memoryとの関係、失敗したときの安全な戻し方も扱います。
vLLMで長い入力を処理するPrefillと、応答を1 tokenずつ返すDecodeを分ける理由を解説します。公式demoを安全に読む順序、KV cache転送の確認点、単一構成へ戻す判断を学べます。
Docker Model Runnerを初めて使う人向けに、対応版の確認、modelのpullとrun、localhostのOpenAI互換APIで最初の応答を確認する手順、失敗時の戻し方を解説します。
llama.cpp b9637で対応するGGUF LoRA adapterをbase modelへ非mergeで読み込み、同じpromptでadapterなし・ありを確認する最短手順と失敗時の戻し方を解説します。
Transformers 5.14.1のgenerate_batchで長さの違う複数promptを処理し、requestごとの結果を確認するまでを、GPU前提、失敗時の戻し方とともに解説します。
OllamaのローカルAPIへ小さなJSON Schemaを渡し、非ストリーミング応答をJSONとして取り出して必須項目と型を確認するまでを、失敗時の戻し方とともに解説します。
Mac、Ubuntu、LinuxでDockerを導入する手順を、インストール方法、確認コマンド、初期設定までまとめた入門ガイド。
Dockerの仕組み、仮想マシンとの違い、イメージとコンテナ、Dockerfile、Compose、基本コマンド、トラブル対応まで図解ベースで解説します。
SSHの仕組み、公開鍵認証、接続設定、ポートフォワーディング、ファイル転送、安全なサーバー運用の注意点をコマンド例とともに解説します。
Macにuvを導入し、Pythonバージョン管理、仮想環境、依存関係、uv.lock、スクリプト実行までを再現できるコマンド例で解説します。
Qwen3.5をローカルで動かすためのモデル選択、必要メモリ、実行環境の準備、llama.cppでの起動手順と動作確認を初心者向けに解説します。