ローカルLLM / LM Studioインストール

・インストール後のおすすめモデルはスキップ

左サイドメニュー一番下から
Qwen3.6-35B-A3B
を検索し、チェックが付いている
MLXの4BIT(20.43 GB)
をそのままダウンロード。

・ビット

実効ビット=ファイルサイズ(GB)*8/パラメータ数(B)
変数が二つあるとモデル比較できないため1つのパラメータにしている。
また、このパラメータが品質の目安になるからというのもある。
3ビット以下は実用性がなく4ビットが標準になっている。
パラメータ数が多いほど低ビットにたえる。同じ容量なら14B・8bitより35B・4bit。

・量子化する

開発元はbf16で公開する(Google、Alibaba、NVIDIAなど)
第三者が低ビットにすること=量子化=q
音楽と一緒で今の配布の基準が16ビットになっているだけ。

・q_4_K_M

q=量子化している印(nvfp4などもある)
4=何ビットか。
K=K-quant方式。第二世代の方式。
M=S/M/LでMが標準、Sは軽量、Lはほとんどない。