ローカルLLMとは?できることと始め方(LM Studio・Ollamaの使い方)
ChatGPTのようなクラウドAIは知っているけれど、「ローカルLLM」という言葉は最近になって見かけた。
検索しても、ChatGPTとの違いや始め方が分からず、迷うかもしれません。
ローカルLLMは、たとえるなら「物知りの人を、自分のPCの中に住まわせる」ようなものです。
クラウドAIの代わりとして何でも任せられるわけではなく、できることとできないことがはっきり分かれます。
この記事では、当サイトが実際に試した結果をもとに、できること・できないことと、LM Studio・Ollamaという2つのアプリでの始め方を紹介します。
- AI(LLM)=分厚い百科事典を持った物知りの人。クラウドAIは遠くにいる物知りの人に聞きに行く仕組み、ローカルLLMは物知りの人を自分のPCに住まわせる仕組み
- GPUのメモリ(VRAM)=物知りの人が使う作業台。広いほど一度に多くのことを扱える
- tok/s=物知りの人が1秒にどれくらいの量の文章を書けるかの目安(1秒に書ける文字のかたまり=トークンの数)
- Thinking(考える設定)=答える前にメモ用紙で下書きしてから話す人
- ローカルLLMは、物知りの人を自分のPCの中に住まわせるイメージ。ネット接続やアカウント登録が無くても、無料で試せます
- 得意なのは資料から情報を探す・資料を読んで答える用途。苦手なのは計算や決まった形式を守ることです
- 始め方はLM Studio(画面操作)とOllama(コマンド操作)の2つ。どちらも無料で使えます
- 当サイトの実測(2026年9月8日・ローカル10種とクラウド1種・471試行)で、得意・苦手の具体例を確認しています
この記事は、2026年9月8日に当サイトがローカルLLM10種とクラウドGPT-6 Astraへ同じ課題を出し、回答を保存した実測(471試行)と、2026年9月30日〜10月1日に測定したLM Studio・Ollamaの起動時の挙動をベースにしています。
計測機材はFRONTIER FRGKB860M/CG3(RTX 5070 Ti 16GB・Core Ultra 7 265F・32GB DDR5・Windows)で、LM Studio 0.4.23・Ollama 0.35.0を使っています。
計測条件の詳細は記事末尾にまとめています。
ローカルLLMとは
自分のPCの中に、分厚い百科事典を持った物知りの人を1人置くようなもの、と考えると分かりやすくなります。
ローカルLLM(LLMはLarge Language Model/大規模言語モデルの略で、文章を生成する仕組みのこと)は、インターネットの先にあるサーバーではなく、手元のPCでその物知りの人を働かせる仕組みです。
ChatGPTやGeminiのようなクラウドAIは、質問を送るたびに遠くにいる物知りの人(メーカーのサーバー)に聞きに行き、返ってきた答えを画面に表示しています。
ローカルLLMは、その物知りの人のデータ(モデルのファイル)を自分のPCに保存し、PCのGPU(画像処理用の演算装置で、AIの計算も担います)という頭脳を使ってその場で答えを作ります。
サーバーに聞きに行く手間が無いぶん、PCの外へ質問や答えが出ていかないという特徴もあります。

物知りの人を自分のPCに住まわせることで、いくつかの特徴が生まれます。
通信が発生しないため、ネット接続が無い場所でも動かせます。
アカウント登録やログインも不要で、物知りの人のデータをダウンロードした時点でそのまま使えます。
多くのモデルは無料で公開されているので、PCとソフトを用意すれば、料金を気にせず試せます。
WindowsだけでなくMacでも動かせますが、この記事で画面を見せる手順はWindowsでの操作に限ります。
- ローカルLLMは、物知りの人(AI)を自分のPCのGPUに住まわせる仕組み
- ネット接続・アカウント登録が無くても使える
- 多くのモデルは無料。Windowsに加えMacでも動く
ローカルLLMでできること・できないこと
自分のPCに住まわせた物知りの人が、実際どんな仕事をこなせるのか確かめました。
当サイトは2026年9月8日、ローカルLLM10種とクラウドGPT-6 Astraに同じ課題を出し、回答を保存する実測を行いました。
予定した試行は471件で、1課題1回の自作テストです。
一般的な知能を順位づける市販のベンチマークとは異なり、どの作業で正解し、どの作業で手直しが必要だったかを示す資料として使っています。

得意なこと:資料から情報を探す・資料を読んで答える
資料の山から必要な箇所を探し出す仕事は、物知りの人の得意分野です。
情報抽出3問と資料読解2問では、ローカル10種すべてが内容に正答しました。
資料から決まった項目を取り出したり、長い文章を読んで要点を答えたりする用途で、ローカルLLMを使える具体例が確認できました。
繰り返し同じ資料を使う事務的な作業であれば、クラウドに送らずPCの中で済ませられる場面が見えてきます。
苦手なこと:計算・決まった形式を守ること
一方で、計算や細かいルールを守る仕事は、物知りの人でも苦手がはっきり出ました。
基本設定での正答数は、10種のモデルで0〜3問(3問満点)でした。
「小数第2位に四捨五入」という表現を「小数第3位を四捨五入して小数点以下2桁まで」と明確にした追試でも、基本設定で正答したのは10種中1つ(gpt-oss 20B)だけで、残りの9種は不達成でした。
決まった出力形式(文字数や指定の書式)を守る要件達成も、モデルによって11〜17問(20問満点)までばらつきが大きく、内容は合っていても形式がずれる例が目立ちました。
質問して、知らないことを「わからない」と答えられたときと、明らかに違う計算結果を自信ありそうに返したときの両方がありました。
実際、RTX 5070 TiのVRAM容量を聞く設問では、10種のうち9種が知らないと正しく表明してnullを返し、残り1種だけが正答しています。
でたらめな数値を答えず、知らないと認めることも、安全に使うために大事な挙動です。
繰り返しや画像の読み取りも試しました
同じ質問を何度も聞いたとき、毎回同じように答えられるかも確かめました。
同じ課題を3回繰り返す安定性のテストでは、文字数や書式まで含めた要件達成が0〜9問(9問満点)と、モデルによってばらつきが大きく出ました。
表やグラフを読み取る画像の課題は、対応しているモデルであれば内容正解1〜2問(2問満点)という結果で、画像に対応していないモデルもありました。
いずれも今回作成した明瞭な表・グラフでの結果で、写真や手書き文字、複雑な画面全般の認識性能を示すものではありません。
「考える」設定にすると変わること
物知りの人の中には、答える前にメモ用紙で下書きしてから話すタイプもいます。
多くのローカルLLMには、Thinkingという「考える」設定があり、回答を出す前に内部で長い思考過程の文章を生成します。
同じ6課題で比べると、Qwen3.8-27Bの2種(量子化の違うQ3とQ4)は、基本設定ではそれぞれ2問・3問の正答でしたが、Thinkingを有効にすると共通6課題すべてに正答しました。
一方で、Qwenの2種の完了時間の中央値は、基本設定の2秒台からThinkingでは26秒台まで伸びています。
下書きする分だけ答えが出るまで待つ時間が長くなる、というイメージです。
正確さが上がる分、待ち時間も伸びる関係にあり、小型のモデルでは考える文章だけで出力の上限に達し、最終的な回答が出ない例もありました。


クラウドAIとの違い
手元の物知りの人と、遠くにいる物知りの人(クラウドAI)とでは、答えの正しさにも差が出ました。
基本20課題(計算・条件判断・情報抽出・不明や矛盾への対応・引用内命令・長文読解・要約・文章修正・文章作成・コード)の内容正解は、ローカル10種が13〜17問(最高はgpt-oss 20Bの17問)、クラウドGPT-6 Astraは20問全問でした。
ただし、ローカルとクラウドでは実行条件が異なります。
クラウドはCodex CLI経由でreasoning低設定、ローカルは主にLM Studio上でSystem Prompt指定なしという違いがあり、生成の上限や温度の設定方法も同じではありません。
内容正解数の差は、同じ条件で測った純粋なモデル性能の比較ではなく、各環境での使用結果として受け取ってください。
- 資料からの情報抽出・資料読解はローカル10種すべてが内容正答
- 計算・決まった形式を守ることは苦手。基本設定での計算正答は0〜3問
- Thinkingを使うと正確さは上がるが待ち時間も伸びる。クラウドとは実行条件が違う
始めるのに必要なPC
物知りの人がどれくらい大きな作業台(GPUのVRAM=GPUが使う専用メモリの容量)を使えるかで、一度に扱える仕事の規模が変わります。
VRAMが大きいほど、一度に扱えるモデルのサイズや文脈の長さが広がります。
8GB程度のVRAMからでも小さめのモデルは試せますが、本格的にPCを選ぶ基準や機種ごとの目安は、別記事「ローカルLLM用PCのスペックの選び方」で詳しく解説しています。
まずは今使っているPCにLM StudioかOllamaを入れ、動かせる範囲を確かめてみてください。

- 目安になるのはGPUのVRAM容量(物知りの人の作業台の広さ)
- 8GB程度からでも小さめのモデルは試せる
- 本格的なPCの選び方は別記事で確認し、まずは今のPCで試す
始め方:どちらのアプリを選ぶか
物知りの人を自分のPCに呼び込む窓口が、LM StudioとOllamaの2つです。
どちらも無料で、モデルのダウンロードから実行まで進められます。
LM Studioは、画面操作に慣れたい人に向いています。
GUI(グラフィカル・ユーザー・インターフェース)方式のアプリで、画面上のボタンやアイコン、メニューをマウスで操作します。
Ollamaは、コマンド操作に抵抗がない人に向いています。
CLI(コマンドライン・インターフェース)方式のアプリで、ターミナルという画面に文字でコマンドを入力して操作します。

- LM Studio=画面操作(GUI)、Ollama=コマンド操作(CLI)
- どちらも無料でモデルのダウンロードから実行まで進められる
- 画面操作に慣れたいか、コマンド操作でよいかで選べる
LM Studioの使い方
LM Studioは、公式サイトからインストーラーをダウンロードしてインストールします。
起動すると、モデルを検索するタブが用意されています。
検索欄にモデル名を入力し、一覧からダウンロードしたいモデルを選んでクリックすると、ダウンロードが始まります。
ダウンロードが終わったら、チャット画面を開いてモデルを読み込みます。
入力欄に質問を入力すると、回答が返ってきます。


LM Studioを初めて起動し、モデルを検索してダウンロードし、チャット欄に入力するまでの操作は、スマートフォンのアプリでメッセージを送る手順と大きく変わりませんでした。
画面の指示に沿って進めるだけなので、ターミナル操作に慣れていなくても迷いにくい流れです。
- 手順はインストール→モデルを検索してダウンロード→チャットで質問
- モデル検索も実行もすべて画面の中で完結する
- 操作感はスマートフォンのメッセージアプリに近い
Ollamaの使い方
Ollamaは、公式サイトからインストーラーをダウンロードしてインストールします。
インストール後にターミナルを開き、バージョン確認のコマンドで、正常にインストールできたか確かめます。
モデルを動かすときは、ターミナルで実行コマンドにモデル名を指定して1行打つだけです。
モデルがまだ手元に無ければ、モデルを指定した実行コマンドでダウンロードから実行まで自動で進みます。
起動が終わると、チャット形式で質問を入力できます。


Ollamaはターミナルでコマンドを1行打つと、モデルのダウンロードから起動まで自動で進みました。
画面に何も表示されない時間が数秒あり、進んでいるのか分かりにくい場面がありました。
コマンド1行で済む手早さはありますが、画面に何も出ない間は待つ必要があります。
- 手順はインストール→ターミナルでモデルを指定して実行→そのまま質問
- コマンド1行でダウンロードから起動まで自動で進む
- 画面に表示が出ない時間があるので、進行中と知って待つとよい
始めるときに気づいた2点
同じ物知りの人(モデルファイル)でも、呼び込み方によって仕事ぶりが変わる場面がありました。
同じモデルファイルを3つのアプリ(llama.cpp・LM Studio・Ollama)で動かし、起動直後の既定設定を比べる計測を2026年9月30日〜10月1日に行いました。
起動時の設定について、気づいた点が2つあります。
1つ目は、LM Studioを既定のままロードすると、生成速度が13.8トークン/秒にとどまる例があったことです。
トークンはAIが文章を生成するときの処理単位で、生成速度はトークン毎秒(tok/s)=物知りの人が1秒にどれくらいの量の文章を書けるかの目安です。
一部の層がGPUではなくCPU側に割り当てられていたためで、GPUの割り当てを手動で最大に指定すると49.5トークン/秒まで戻りました。
2つ目は、Ollamaは既定のまま全層をGPUに割り当て、51.1トークン/秒で動いたことです。
いずれも同じモデルファイルを使った既定のロード挙動の違いで、アプリ自体の速度を比較する計測ではありません。

初めて使ってチャットの応答が遅いと感じたら、GPUの割り当て設定を確認してみてください。
今回の計測では、GPUの割り当て設定を合わせると、どちらのアプリでも近い速度で動きました。
- LM Studioは既定のままだと一部の層がCPU側に回ることがある
- Ollamaは既定で全層GPUに割り当たった
- 遅いと感じたらGPUの割り当て設定を見直すとよい
どのモデルから試すか
物知りの人にもいろいろな得意分野・大きさがあるように、ローカルLLMにもモデルごとの個性があります。
初めて動かすときは、まず軽量なモデルを選び、応答速度やVRAMの使い方を確かめると迷いにくくなります。
当サイトでは、16GBのVRAMで動かせるモデルを個別に実測した記事を公開しています。
Qwen3.8-27B(16GB VRAM)は、量子化(モデルのサイズを小さくする変換処理)を工夫すると27Bクラスの大きめモデルでも16GBのVRAMに全体を載せられます。
gpt-oss-20b(16GB VRAM)は、今回の基本20課題で内容正解17問と、ローカル10種の中で最も高い数値を記録したモデルです。
Gemma 4 26B-A4B(16GB VRAM)は、16GBのVRAMに全層GPUで載り、速さを実測したモデルです。
各モデルの記事で実測値や始め方の続きを紹介しています。
気になるモデルの記事を読んでみてください。
- まずは軽量なモデルから試して、速さや使い方に慣れる
- 16GB VRAMで動かせるモデルはQwen3.8-27B・gpt-oss-20b・Gemma 4 26B-A4Bを実測済み
- 詳しい実測値は各モデルの個別記事で確認できる
まとめ
ローカルLLMは、物知りの人を自分のPCの中に住まわせる仕組みです。
ネット接続やアカウント登録が無くても、無料で試せます。
当サイトの実測では、資料から情報を探す・資料を読んで答える用途で使える具体例がありました。
一方で、計算や決まった形式を守ることは苦手という、はっきりした違いが見えました。
Thinkingを使えば正確さは上がりますが、待ち時間も伸びるので、用途に合わせて使い分けてみてください。
始め方は、画面操作で進めたいならLM Studio、コマンド操作に抵抗がないならOllamaを選べます。
どちらも無料で、インストールしてから数ステップで最初の質問を試せます。
ファインチューニングやRAG(検索した資料をもとに回答させる仕組み)による強化は、この記事では扱わず、別記事で扱う予定です。
まずは今のPCで、軽量なモデルから試してみてください。
よくある質問
ローカルLLMとクラウドAIの違いは何ですか?
クラウドAIは遠くにいる物知りの人(メーカーのサーバー)で動き、質問を送るたびに通信します。
ローカルLLMは物知りの人を自分のPCの中に住まわせるため、通信やアカウント登録が無くても使えます。
当サイトの実測では、基本20課題の内容正解がクラウド20問に対しローカルは13〜17問で、実行条件が異なるためこの差をモデル性能だけの違いとは断定していません。
ローカルLLMは無料ですか?
多くのモデルとアプリ(LM Studio・Ollama)は無料で公開されています。
必要なのはモデルを動かせるPCと、ダウンロードの通信環境だけです。
LM StudioとOllamaはどちらがよいですか?
画面を見ながらボタンやメニューで操作したい人にはLM Studio、ターミナルでコマンドを打つ操作に抵抗がない人にはOllamaが向いています。
当サイトの計測では、既定の設定のままだとLM Studioの生成速度が遅くなる例がありましたが、GPUの割り当てを手動で指定すると、Ollamaに近い速度まで戻りました。
速さの優劣を断定するものではなく、設定次第で変わる差です。
どのくらいのPCがあれば動きますか?
目安になるのはGPUのVRAM容量(物知りの人が使う作業台の広さ)で、8GB程度からでも小さめのモデルを試せます。
扱えるモデルの幅を広げたい場合の詳しい選び方は、別記事「ローカルLLM用PCのスペックの選び方」で解説しています。
インターネット接続は必要ですか?
モデルをダウンロードするときだけ通信が必要です。
ダウンロードが終われば、質問して回答を受け取るやり取り自体はPCの中だけで完結し、ネット接続が無い場所でも動かせます。
計測条件
- 品質テスト計測日:2026年9月8日(ローカル10種・クラウドGPT-6 Astra・1課題1回の自作テスト・471試行)
- アプリ挙動の計測日:2026年9月30日〜10月1日(同じモデルファイルをllama.cpp・LM Studio・Ollamaで読み込み、既定の割り当てを比較)
- 計測機材:FRONTIER FRGKB860M/CG3(RTX 5070 Ti 16GB・Core Ultra 7 265F・32GB DDR5・Windows)
- 使用ソフト:LM Studio 0.4.23・Ollama 0.35.0
- 品質テストの判定:「内容正解」は形式違反を除いた内容の正しさ、「要件達成」は形式・文字数も含めた判定。文章は機械補助判定で、全回答を保存
- 課題・採点基準・質問・応答全文・実行設定・追試の生データを保存済み