ローカルLLM 実行環境

RTX 3050 Ti Laptop(VRAM 4GB)/RAM 16GB のノートPCで llama.cpp を動かす
📅 作成: 2026-08-24 / 更新: 2026-08-25
プロジェクトの状況

このプロジェクトについて

手元のノートPCでローカルLLMを常用できる状態にする。 実行基盤は llama.cpp、モデルは C:\AI_Models にある手持ちのGGUFを流用する方針。

現在の段階

段階状態
計画完了下記の計画書にまとめてある
モデルの棚卸し完了重複していた 12.6 GB を整理(98.5 → 86.0 GB)
llama.cpp の配置完了b10612(CUDA 12.4)を bin\llama.cpp\ に展開
起動スクリプト完了scripts\ に4種類(常用・品質重視・9B・MoE)
速度の実測完了下記のとおり。計画書の第10章に詳細
品質の評価完了質問セット5問すべてを Qwen3-4B と E4B で実施。使い分けの基準を確定
Claude Code 接続未着手API 動作は確認済み。接続先を 127.0.0.1:8080 に向け替えるだけ

環境

項目内容
GPUNVIDIA GeForce RTX 3050 Ti Laptop(VRAM 4 GB)/ドライバ 592.82
CPU / RAMIntel Core i7-11370H(4コア8スレッド)/15.8 GB
モデル置き場C:\AI_Models(LM Studio と共用・約 86.0 GB / 26ファイル)
既存ツールLM Studio 導入済み。Ollama はアンインストール済み

実測した生成速度

用途モデルと設定速度
資料を渡す作業Qwen3-4B-Instruct-2507 -ngl 99 -c 819256.5 tok/s
知識を問う時gemma-4-E4B-it -ngl 99(reasoning)45.2 tok/s
用途限定Qwen3.5-9B -ngl 24 +KV量子化8.1 tok/s
用途限定gpt-oss-20b --n-cpu-moe 185.9 tok/s
分かれ目は「答えが渡した文章の中にあるか」。 質問セット5問の結果、1970字の読解と413字の要約では Qwen3-4B が E4B と同じ正確さで3〜6倍速かった。 差が出たのは知識を問う設問だけで、Qwen3-4B は「量子化とは」の説明で量子力学と混同した誤答を出している。 資料を渡す作業は 4B、渡す資料が用意できない場面だけ E4B という切り分けになる。
予想外だったのは gemma-4-E4B。 ファイルは 4.95 GiB で 9B クラス扱いだったが、Per-Layer Embeddings の 2730 MiB が CPU 側に分離されるため、 GPU には 2868 MiB しか載らず 4B クラスに近い速度で動く。 サイズだけで仕分けると取りこぼすモデルがある。詳細は計画書の第10章。
VRAM を超えても、エラーではなく「5〜40倍遅くなる」形で現れる。 NVIDIAドライバが共有GPUメモリに逃がすため止まらない。 -ngl の付けすぎと、コンテキスト 16384 の指定がこれを起こす。8192 を上限として運用する。

ドキュメント

計画

調査

フォルダ構成

20260824-local-llm-llama-cp/
├─ README.html              … このファイル
├─ bin/llama.cpp/           … b10612 (CUDA 12.4) 一式
├─ scripts/
│   ├─ run-server.cmd       … 常用 (Qwen3-4B)
│   ├─ run-server-e4b.cmd   … 品質重視 (gemma-4-E4B)
│   ├─ run-server-9b.cmd    … Qwen3.5-9B
│   ├─ run-server-moe.cmd   … gpt-oss-20b (MoE)
│   └─ bench.cmd            … 速度計測
├─ docs/
│   ├─ plan/                … 計画書
│   └─ research/            … 個別テーマの調査
├─ src/scripts/70_html2md/  … HTML→Markdown 変換
├─ etc/                     … 補助スクリプト(git管理外)
└─ tmp/                     … ダウンロードしたzip等(git管理外)

C:\AI_Models\                … GGUF の実体(LM Studio と共用・移動しない)