ローカルLLM入門|自宅PCで動かすためのGPU・メモリの選び方
※本記事にはアフィリエイト広告(Amazonアソシエイト・楽天アフィリエイト)のリンクを含みます。
先に結論: モデル規模(7B〜70B級)と量子化から必要VRAM/メモリを逆算するのが基本です。14B級ならVRAM12〜16GB級GPUかMac24GBメモリが目安で、生成速度重視ならGeForce系GPU、静音・省電力重視ならApple Silicon Macが向いています。
ChatGPTやClaudeのようなLLMは通常クラウド上のサーバーで動きますが、モデルファイルを自分のPCに置いて動かす「ローカルLLM」が海外の自作PCコミュニティで盛り上がっています。
Reddit r/LocalLLaMAでは「VRAM24GB級のGPUでも数十B級モデルが動く」という話題が繰り返し反響を呼び、機材選びへの関心が高まっています。
会話データを外部に送信せずに使える、API従量課金が発生しない、ネット接続がなくても動くのがローカルLLMの魅力です。
この記事では2026年8月時点の情報をもとに、モデルサイズ別に必要なVRAM・メモリの目安と、GeForce系GPU・Apple Silicon Mac・ミニPCの3路線の選び方を解説します。
この記事の要点
- パラメータ数(B)÷2が、Q4量子化時のおおよそのGB数の目安です。
- 14B級モデルはVRAM12〜16GB級GPU、またはMacなら24GBメモリが目安です。
- 生成速度重視ならGeForce系GPU(RTX 5060 Ti 16GBで7万円台後半〜)、静音・省電力重視ならApple Silicon Macが向いています。
- 2026年はDDR5メモリ・GPU価格の変動が大きく、1月には年初比3〜5倍まで高騰しました。
- VRAM不足でQ4より量子化ビット数を下げすぎると、応答品質が目に見えて劣化しやすくなります。
ローカルLLMとは何か
ローカルLLMとは、Llama・Qwen・Gemmaといったオープンウェイトのモデルファイルをダウンロードし、自分のPC上で推論(応答生成)まで完結させる使い方です。
クラウドAPIを使うClaude Codeと違い通信は初回のダウンロードのみで、以降は完全にオフラインで動作します。
医療・法務など機微な情報を扱う検証や、ネット環境を選ばない開発端末として選ばれる一方、応答品質はまだクラウドの最新モデルに一歩譲る場面が多いのが実情です。「完全な代替」ではなく「用途を選んで使い分ける手段」と捉えましょう。
モデルサイズ×量子化と必要VRAM/メモリの早見表
ローカルLLM選びで最初につまずくのが、モデルの「パラメータ数(7B・14Bなど)」と「量子化(Q4・Q8など)」の組み合わせで必要なVRAM・メモリが変わる点です。
量子化とは、モデルの重みを4bitや8bitといった低精度に圧縮して保存する技術で、精度をわずかに犠牲にする代わりにファイルサイズと必要メモリを大きく削減できます。複数の技術情報源を照合した2026年8月時点の目安は次のとおりです。
| モデル規模 | Q4量子化の目安サイズ | 快適に動かせるハードウェアの目安 |
|---|---|---|
| 7B〜8B級 | 約4〜6GB | VRAM 8GB級GPU、Macなら16GBメモリ |
| 14B級 | 約8〜10GB | VRAM 12〜16GB級GPU、Macなら24GBメモリ |
| 32B級 | 約18〜20GB | VRAM 24GB級GPU、Macなら32GB以上メモリ |
| 70B級 | 約40GB前後 | VRAM 48GB以上(マルチGPU)、Macなら64GB以上メモリ |
目安として「パラメータ数(B)を2で割った数値がQ4量子化時のおおよそのGB数」と覚えておくと概算しやすくなります。ただしこれはモデル本体のサイズで、実際の運用では会話履歴を保持するコンテキスト長分のメモリが追加で必要です。量子化を4bitより下げると応答品質が目に見えて劣化しやすいため、VRAM不足を理由にむやみに量子化ビット数を下げすぎないことも実用上のポイントです。
ハードウェアの選び方:3つの路線
必要VRAM/メモリの目安をもとに、実際の機材選びを3つの路線で比較します。
| 路線 | 得意分野 | 予算帯の目安 |
|---|---|---|
| ①GeForce系GPU搭載デスクトップ | 生成速度重視、32B級までを高速に動かしたい人 | GPU単体で7万円台後半〜 |
| ②Apple Silicon Mac | 静音・省電力で大きめのモデルも動かしたい人 | 本体込みで15万円前後〜 |
| ③ミニPC+大容量RAM | 小型モデルを常時稼働のサーバーとして動かしたい人 | 本体3万円台〜+メモリ増設 |
なお3路線の上位「本格投資枠」として、128GBユニファイドメモリを積んだNVIDIAのAI開発デスクトップも2026年から個人購入可能になりました。
Mac StudioやRTX 5090と迷う方はDGX Sparkは買い?Mac Studio・RTX 5090とローカルLLM用途で比較もご覧ください。
①GeForce系GPU搭載デスクトップ:VRAM重視の選び方
最も生成速度を出しやすいのがGeForce系GPUを積んだデスクトップです。ローカルLLMではGPU性能より先にVRAM容量そのものが「動くか動かないか」の壁になるため、まずVRAM容量から逆算するのが定石です。
16GB VRAMのGeForce RTX 5060 Ti 16GB(2026年8月時点で7万円台後半〜10万円台)は14B級までを快適に動かせる現実的な選択肢で、20B級はコンテキスト長を絞ればどうにか動く程度が上限です。
dense型の32B級を16GB級GPUで安定運用するのは現実的でないという評価が多く、20B級前後を実用上限の目安とみておくのが無難です。
複数枚でVRAMを合算するマルチGPU構成を検討する場合は、ドライバの対応状況からNVIDIA製で統一するのが無難です。
②Apple Silicon Mac:ユニファイドメモリの強み
Apple SiliconのMacは、CPUとGPUが同じメモリ(ユニファイドメモリ)を共有する設計のためメモリ容量がそのまま「実質的なVRAM容量」として使えるのが最大の強みで、静音・省電力に大きめのモデルを動かせます。
Mac miniのM4モデルは標準16GB・24GBへのカスタマイズが可能で、より大きく見据えるならM4 Proモデル(標準24GB、48GBへのカスタマイズ可)が現実的な上限です。2026年8月時点でApple公式ストアに32GBの選択肢はなく、24GB前後か48GB構成かを予算と相談して決めます。
機種選び・メモリ容量別の目安はMacでローカルLLMを動かすで深掘りしています。常時稼働にはファンレス設計のノート型より排熱に強いMac miniやMac Studioのようなデスクトップ型が安定します。
以下はいずれもM4・512GB SSD構成で、Amazonが24GBメモリの整備済み品、楽天が16GBメモリの中古品(ランクA)です。
③ミニPC+大容量RAM:小型モデルをCPU/内蔵GPUで動かす
専用GPUを積まずに、ミニPC本体のメモリを増設してCPUや内蔵GPUで7B〜8B級の小型モデルを動かすのも現実的な選択肢です。
Ryzen AI搭載のBeelink SER8のようなモデルはNPUや内蔵GPUを備え、常時稼働のサーバー用途に向いています。
初期費用を抑えたいなら中古ビジネスPCで自宅サーバーを組むと組み合わせ、中古機で試してから投資する順番でも構いません。CPU実行前提ならメモリの絶対量がボトルネックになりやすいため、DDR5メモリの増設で余裕を持たせましょう。
リンク先はTeam製DDR5-6400 32GB×2枚(64GB)キットの例です。
2026年のGPU・メモリ価格高騰と買い時の考え方
2026年はAIデータセンター需要でDDR5メモリ価格が2025年後半から高騰し、2026年1月には年初比3〜5倍に達しました。
2月以降いったん値下がりしたものの7月第1週には再び上昇に転じるなど、「下がりきってから買おう」という待ち方が通用しにくい相場です。
GPU本体も同様の影響を受けやすいため、小さめのモデルで試すだけなら無理に高VRAM機を揃える必要はなく、Amazonプライムデーなど大型セールで必要な分だけ揃える考え方が現実的です。購入直前に価格.comやAmazonで最新価格を確認してください。
この相場を前提に整理した内容はメモリ高騰時代のAI開発PC買い時戦略で解説しています。
2026年8月には低価格戦略で知られていたDeepSeekがAPI料金の大幅値上げを発表し、クラウドAPIの値上げが相次ぐ中で「ローカルLLMに回帰すべきでは」という話題も広がりました。
高価格帯のGPUを買えなくても、8.5GB前後で動く軽量なMITライセンスモデルの登場など、手元の機材でできることは着実に広がっています。まずは今ある環境で小さめのモデルから試し、必要に応じて拡張していきましょう。
入門用ソフトウェア:OllamaとLM Studio
モデルを動かすソフトは、入門用としてOllamaとLM Studioが代表的です。Ollamaはターミナルからコマンドでモデルをダウンロード・実行するCLI中心のツールで、自動化やAPI連携との相性が良く常時稼働のサーバー用途に向いています。
LM StudioはGUIでモデルを検索・ダウンロードし、チャット画面からすぐ試せるツールで、コマンド操作に不慣れな人でも扱いやすいのが特徴です。2026年にはヘッダレスのサーバーモードも追加され、慣れてきたらAPIサーバーとしても常時起動できます。
止めずに動かし続けたい場合はClaude Code常時稼働環境の作り方の考え方が参考になります。
つまずきポイント
- VRAM不足でロードできない:「動きます」と紹介されるモデルでもVRAMがわずかに足りずロードエラーになることがあります。コンテキスト長の余裕を見て1段階小さいモデルか量子化ビット数を上げましょう。
- 量子化を下げすぎて精度が落ちる:VRAM不足を理由にQ4より下げると誤字や文脈の取り違えが目立ちます。モデルサイズの見直しを優先しましょう。
- 電源容量・排熱を見誤る:高VRAMのGPUは消費電力が大きく、電源ユニットや排熱を確認せず組み込むとフリーズや強制シャットダウンの原因になります。
- Macのメモリは購入後に増設できない:Apple SiliconのMacはユニファイドメモリが基板に直付けのため増設できません。将来動かしたいモデルサイズを見越して購入時に決めましょう。
- モデルファイルの置き場所を用意し忘れる:量子化済みでも1モデル数GB〜数十GBになり、複数試すとストレージを圧迫します。作業用SSDとは別にミニNASのような保存先を用意すると管理が楽になります。
よくある質問
ゲーミングPCがあればそのままローカルLLMを動かせますか?
GPUを積んでいれば動きますが、ゲーミング用途のGPUはVRAM 8〜12GB級が多く、14B級以上には不足しがちです。まず今のVRAM容量を確認し、早見表と照らし合わせて動かせるモデル規模を見積もりましょう。
ノートPCでもローカルLLMは動きますか?
7B級程度なら内蔵GPUやCPUだけでも動作可能ですが、発熱と電力消費が大きくバッテリー駆動の長時間利用には向きません。常時稼働させたいなら本記事のミニPCやデスクトップへの移行を検討してください。
OCuLink対応のミニPCなら外付けGPU(eGPU)でVRAMを増強する道もあり、手順はミニPCにeGPUを増設してローカルLLMを動かすで解説しています。
クラウドのClaude/ChatGPTと比べてどちらを使うべきですか?
最新かつ最高品質の応答が必要な作業には依然としてClaudeのようなクラウドAIに分があります。ローカルLLMは機微な情報を外部に出したくない検証、ネット接続のない環境、API課金を気にせず試行錯誤したい場面など、用途を絞って使い分けるのが現実的です。
GPUは何GBあれば「元が取れます」か?
海外コミュニティでも、VRAM 6GBから16GBへの買い替え相談は定番の話題です(1スレッドで293件のコメントが集まった例も)。ただしコスト面ではクラウドAIの従量課金の方が安くつくことが多く、「元を取る」発想での機材選びはあまり現実的ではありません。
ローカルLLMの価値はプライバシー・オフライン性・自由度にあり、選ぶなら早見表のとおり14B級まで扱える16GBが実用に足る最初のラインです。
まとめ
ローカルLLMは、モデルサイズ(7B〜70B級)と量子化(主にQ4)から必要VRAM/メモリを逆算し、GeForce系GPU・Apple Silicon Mac・ミニPCのどの路線で揃えるかを決めるのが基本です。2026年8月時点は価格変動が大きいため、必要な規模を見極めて機材を揃えましょう。
常時稼働で運用したい場合はミニPC選びの記事や中古ミニPCという選択肢も参考に、まずは小さめのモデルから試してみてください。