
DwarfStarで45 TPS?DeepSeek V4 Flashの128GB推論
DwarfStarでDeepSeek-V4-Flashを128GB環境・45 TPSで動かし、Huihuiのabliterated版へ差し替えたX投稿を検証。1M文脈、KVキャッシュ、2bit量子化の注意点を解説します。
記事を読むTAG
GGUFの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全8件。

DwarfStarでDeepSeek-V4-Flashを128GB環境・45 TPSで動かし、Huihuiのabliterated版へ差し替えたX投稿を検証。1M文脈、KVキャッシュ、2bit量子化の注意点を解説します。
記事を読む
DGX Spark 1〜4台でDeepSeek-V4-FlashとGLM-5.2の量子化モデルをどこまで動かせるか。GGUF・FP8の実サイズ、必要メモリ、200GbE接続を比較します。
記事を読む
Qwen3.6-27Bと35B-A3Bの公式性能、モデル構造、GGUF容量を比較し、llama.cppで再現可能な速度・品質ベンチマークを行う方法を解説します。
記事を読む
DeepSeek V4 Flashのllama.cpp対応状況を公式・本流・コミュニティに分け、モデル規模、必要メモリの下限、導入判断と再現可能な測定方法を解説します。
記事を読む
2026年7月12日時点のllama.cppについて、GGUF、llama-server、量子化、マルチモーダル、対応バックエンドと更新時の注意点を整理します。
記事を読む
llama.cpp公式Dockerイメージを使い、CPUまたはNVIDIA GPUでOpenAI互換APIサーバーを安全に起動する方法を解説します。
記事を読む
llama.cppの主要パラメータを2026年7月の公式情報に基づき整理。llama-cli・llama-serverのGPU、コンテキスト、KV Cache設定を用途別にすぐ引けます。
記事を読む
Apple Silicon Macでllama.cppを導入し、GGUFモデル、Metal/GPU活用、基本コマンド、性能確認を行うためのガイド。
記事を読む