ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

入門

Transformersの4-bit・8-bit量子化入門

Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。

入門

Ollama埋め込みAPI入門:近い文を探す

Ollamaの埋め込みを初めて使う人向けに、同じmodelで文書と質問をvector化し、件数・次元・単位長を確認して、cosine similarityで最も近い短文を選ぶ最短手順と戻し方を解説します。

技術解説

Ollama Embeddingsの検証設計

Ollama v0.32.6の埋め込みAPIを対象に、model digestと評価集合を固定し、batch size、dimensions、truncate、keep_aliveを一変数ずつ変えて、recall、時間、memory、error率を比較する机上検証計画です。