RLR-0016 ・ 更新 2026/10/11
ローカルLLMが長文を忘れる?Ollamaのコンテキスト長とVRAMの関係を初心者向けに解説
Ollamaで長い資料や会話を扱うときの「コンテキスト長」とVRAMの関係を解説。公式の4K・32K・256K目安、64K設定、ollama psでの確認、KVキャッシュの注意点を整理します。
結論:モデルの大きさだけでなく「会話を何文字分覚えておけるか」も重要
ローカルLLMを使っていて、長い会話の前半を忘れたような返事が出たり、大きな資料をうまく扱えなかったりした経験はありませんか。
原因は一つではありませんが、確認したい設定の一つが**コンテキスト長(context length)**です。これは、モデルが一度に参照できる情報量を「トークン」という単位で表したもの。日本語の文字数とトークン数は一致しません。
😺「大きなモデルを入れたら、長い会話も全部覚えてくれるんじゃないの?」
🐈⬛「モデルの能力と、実際に割り当てたコンテキスト長は別なんだ。しかも長くするとVRAMも使うよ」
この記事では、ローカルLLM実行ツールOllamaの公式ドキュメントをもとに、初心者が押さえたい設定と確認方法を整理します。Rossy Laboratoryで各GPU・各モデルの実測比較を行った記事ではありません。
コンテキスト長とは?「モデルが見られる作業机」の広さ
たとえば長いPDFの要約、複数ファイルを使うコーディング、会話を続けながらの調査では、過去の入力や参照資料を一度に扱う必要があります。
コンテキスト長が小さいと、アプリケーション側の処理方法によっては古い会話や資料の一部が範囲外になることがあります。ただし、回答が間違う原因をすべてコンテキスト長のせいにすることはできません。検索・分割・要約の仕組みやモデル自体の能力も関係します。
ここで区別したいのが次の二つです。
| 用語 | 意味 |
|---|---|
| モデルが対応する最大コンテキスト | モデルや実装が扱えるとされる上限 |
| 実際に割り当てたコンテキスト | 今のOllama環境で実際に使用する設定値 |
モデルの紹介ページに「128K対応」と書いてあっても、現在の実行設定が128Kとは限りません。
Ollama公式が示すVRAM別の目安
2026年10月11日に確認したOllamaの公式「Context length」ページでは、VRAMに応じた既定コンテキスト長の目安が次のように説明されています。
| 公式ドキュメントのVRAM区分 | 記載されている既定値 |
|---|---|
| 24 GiB未満 | 4K(約4,000トークン) |
| 24〜48 GiB | 32K(約32,000トークン) |
| 48 GiB以上 | 256K(約256,000トークン) |
ここで注意したいのは、「32Kと書かれているから、24GBのGPUならどんなモデルでも32Kが快適」という意味ではないことです。モデル本体の重み、KVキャッシュ、ほかのアプリのGPU使用量などで必要なメモリは変わります。モデル自身の対応上限も超えられません。
また、公式FAQの「How can I specify the context window size?」には一般的な既定値として4096トークンという記述も残っています。公式ページ同士で説明の粒度が異なるため、上の表をすべてのバージョン・環境で保証される値と受け取らず、実際の割り当てを確認するのが安全です。
なぜ長いコンテキストはVRAMを使うの?
LLMは会話や資料を処理する際、モデルの重みだけでなく、過去のトークンに関する計算結果を保持するKVキャッシュなどのメモリを使います。
一般にコンテキストを長くすると、その分だけ必要なメモリも増えます。つまり、モデルのファイルサイズがGPUのVRAMに収まることと、長文を扱えることは別問題です。
さらに、Ollama公式FAQでは並列リクエスト数もメモリ使用量に影響すると説明しています。複数の処理を同時に走らせる使い方では、単独チャットより余裕を見ておく必要があります。
設定する前に「ollama ps」で確認しよう
Ollama公式が案内している確認コマンドはこちらです。
ollama ps
実行中のモデルについて、表示される列のうち注目したいのは次の二つです。
- CONTEXT:割り当てられたコンテキスト長。
- PROCESSOR:モデルがGPUとCPUのどちらに、どの程度配置されているか。
100% GPUならGPU側に全体が配置されています。CPU/GPUの割合が混在していれば、一部がシステムメモリ側に配置されている状態です。なお、ollama psの表示内容や形式はバージョンによって異なる場合があります。
大きなモデルを使っていて動作が急に遅くなった場合は、コンテキスト設定を上げる前後で、この表示やGPUメモリの使用状況を比べると判断しやすくなります。
64Kにしたいときはどうする?
Ollama公式は、Web検索・エージェント・コーディングツールなど長い文脈を必要とする用途に、少なくとも64,000トークンを推奨しています。ただしこれは「64KならどのGPUでも動く」という保証ではありません。
Ollamaアプリでは設定画面のスライダーから変更できます。サーバーをコマンドで起動する環境では、公式は次の環境変数の例を掲載しています。
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
この表記はUnix系シェルの例です。WindowsのPowerShellにそのまま貼るためのコマンドではありません。 Windows版Ollamaではユーザー環境変数の設定とアプリの再起動が必要になる場合があります。実際の起動方法に合わせて公式FAQのWindows手順を参照してください。
また、ollama runの対話中は /set parameter num_ctx、APIでは num_ctx オプションで指定できることもFAQに記載されています。設定経路が複数あるため、変更後は ollama ps で反映を確かめましょう。
VRAMが足りないとき、KVキャッシュ量子化は助けになる?
Ollama公式FAQには、Flash Attentionが有効な場合にKVキャッシュを量子化してメモリを節約する仕組みが説明されています。
| KVキャッシュ形式 | 公式の説明 |
|---|---|
f16 | 既定値。精度とメモリ使用量が高い |
q8_0 | f16の約半分のメモリ。精度低下は比較的小さい |
q4_0 | f16の約4分の1のメモリ。品質への影響が目立つ場合がある |
ただし、これらはKVキャッシュ部分の比較であって、LLM全体のVRAM使用量が半分や4分の1になるわけではありません。モデルによっては精度への影響も異なります。まずはコンテキスト長とモデルサイズの調整から考え、必要になった段階で検討するとよいでしょう。
AI用PC・GPU選びで見るべきポイント
ローカルLLM用のPCを選ぶときは、単に「何Bのモデルが動くか」だけでなく、どんな作業を、どのくらい長い文脈で行いたいかを先に決めると比較しやすくなります。
- 短いチャット中心:コンテキスト長をむやみに増やさず、モデルの応答速度や扱いやすさを優先する。
- 長文資料の整理:必要なトークン数と、モデル本体+KVキャッシュのメモリを考える。
- コーディングエージェント:長い文脈と複数ツールの利用を見込み、VRAMに余裕を持たせる。
24GBクラスのGPUでも、モデルと設定の組み合わせによってできることは変わります。「VRAM 24GBだから64Kは絶対無理」「32GBなら何でも動く」といった一律の結論は避けましょう。
まとめ:最初に変えるのはGPUではなく、確認方法かもしれない
ローカルLLMで長い会話や資料を扱いたいなら、まずは現在のコンテキスト長を確認するところから始めるのがおすすめです。
Ollamaの公式ドキュメントではVRAM別の目安と設定方法が公開されていますが、必要メモリはモデルや使い方によって変わります。設定値だけを大きくしても、快適さが比例して増えるとは限りません。
「モデルの対応上限」「実際の割り当て」「VRAMの余裕」を分けて考える。それが、ローカルAI用PCを選ぶときにも役立つ基本です。
情報確認日:2026年10月11日。Ollamaの仕様・画面・既定値は更新される可能性があります。
SOURCES