CATEGORY

入門

入門の導入、設定、活用方法を実例とともに解説する記事一覧です。 全30件。

入門

GLM-5.3-FlashのGPU・API選び

GLM-5.3-Flashの320B総parameter・18B active、FP8/BF16、Transformers 5.16.1・vLLM・SGLang対応を確認し、複数GPUとAPIの分岐を判断します。

入門

Qwen3 4B・8B・30B-A3Bの選び方

Qwen3 4B・8B・30B-A3Bを公式品質表、32Kネイティブ/YaRN拡張context、量子化artifact容量から比較し、8GB GPU、16GB Mac、24GB GPU、H100で候補にできる範囲を判断します。

入門

Llama 4 Scout・MaverickのH100選び

Llama 4 ScoutとMaverickを、正確なmodel ID、109B/400B total、10M/1M context、Int4/BF16/FP8、H100構成、画像入力、Community Licenseから選ぶ実用ガイドです。

入門

Mistral Small 4のAPI・GPU選び

Mistral Small 4のAPI、BF16、NVFP4、EAGLEを、119B、256K context、公式artifact容量、H100/H200/B200要件から選ぶ実用ガイドです。未測定の速度とpeak memoryも分けます。

入門

Gemma 3n E2BとE4Bの端末別選び方

Gemma 3n E2B ITとE4B ITを、2GB/3GBの公式memory目安、32K context、画像・音声入力、Google公表品質から選ぶガイドです。速度未測定の範囲も分けて判断できます。

入門

gpt-oss 20bと120bの機器別選び方

gpt-oss-20bと120bを、16GB memory、Apple Silicon、H100 80GB、Windowsで選ぶガイドです。MXFP4の公式容量目安、128K context、現行runtime、未測定範囲を分けて判断できます。

入門

Nemotron 3 NanoをH200で選ぶ実用ガイド

Nemotron 3 Nano 30B-A3BのBF16・FP8、gpt-oss-20b、Qwen3-30B-A3Bを、NVIDIA公表の単一H200・8K入力・16K出力へ限定して読み、H200、H100、NIMで候補を選ぶ方法を解説します。

入門

Gemma 4 12Bと26B-A4Bの選び方

Gemma 4 12Bと26B-A4Bを、32GB Mac、24GB GPU、H100 80GBで選ぶ実用ガイドです。公式memory表、現行revision、対応runtime、未実測範囲を分けて判断できます。

入門

OllamaのModelfileで設定を再利用する入門

OllamaのModelfileにベースモデル、system指示、生成parameterを記録し、ollama createとrunで同じ定義を呼び戻す手順を初心者向けに説明します。失敗時の切り分けと、タグだけに頼らない確認方法も整理します。

入門

Responses APIで2回目の会話を続ける入門

OpenAI公式SDKでResponses APIを1回呼び、output_textとresponse.idを確認して2回目へ引き継ぐ最短手順を解説します。API keyの扱い、成功確認、失敗時の戻し方、未実行の範囲も明記します。

入門

Hugging FaceモデルをGGUFへ変換して量子化する

llama.cpp b10447でHugging Faceの対応モデルを高精度GGUFへ変換し、Q4_K_Mへ量子化して読み込みを確認する手順を解説します。必要なRAM・disk、再量子化を避ける理由、未実行の検証範囲も明記します。

入門

TransformersでGGUFを読み込む入門

Transformers v5.15.0で小型GGUFをtokenizerとmodelへ読み込み、最初の生成を確認します。逆量子化後のmemory、失敗時の切り分け、元へ戻す方法まで解説します。

入門

llama.cpp投機的decode入門

llama.cpp b10328を基準に、追加model不要のn-gram方式をbaselineから有効化し、応答完了、draft token、acceptanceを確認して元へ戻す最短手順を説明します。

入門

Transformersの4-bit・8-bit量子化入門

Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。

入門

Ollama埋め込みAPI入門:近い文を探す

Ollamaの埋め込みを初めて使う人向けに、同じmodelで文書と質問をvector化し、件数・次元・単位長を確認して、cosine similarityで最も近い短文を選ぶ最短手順と戻し方を解説します。

入門

TensorRT-LLMのPyTorch移行入門

TensorRT engine backend削除後のTensorRT-LLMを初めて扱う人向けに、対応環境の確認、checkpointからtrtllm-serveを起動する最短手順、成功確認、失敗時の戻し方を解説します。

入門

MLX LMのPrompt Cache入門:長文を再利用する

Apple Silicon MacでMLX LMの共通promptをcache fileへ保存し、別の質問で再利用する手順を解説します。確認方法、memoryとの関係、失敗したときの安全な戻し方も扱います。

入門

vLLMのPrefill/Decode分離を理解する入門

vLLMで長い入力を処理するPrefillと、応答を1 tokenずつ返すDecodeを分ける理由を解説します。公式demoを安全に読む順序、KV cache転送の確認点、単一構成へ戻す判断を学べます。

入門

Docker Model Runner入門:最初のAPI応答まで

Docker Model Runnerを初めて使う人向けに、対応版の確認、modelのpullとrun、localhostのOpenAI互換APIで最初の応答を確認する手順、失敗時の戻し方を解説します。

入門

llama.cppでLoRAを非merge適用する入門

llama.cpp b9637で対応するGGUF LoRA adapterをbase modelへ非mergeで読み込み、同じpromptでadapterなし・ありを確認する最短手順と失敗時の戻し方を解説します。

入門

Transformers連続バッチング入門

Transformers 5.14.1のgenerate_batchで長さの違う複数promptを処理し、requestごとの結果を確認するまでを、GPU前提、失敗時の戻し方とともに解説します。

入門

OllamaでJSON Schema出力を作る入門

OllamaのローカルAPIへ小さなJSON Schemaを渡し、非ストリーミング応答をJSONとして取り出して必須項目と型を確認するまでを、失敗時の戻し方とともに解説します。