AI代が高い人へ|Gemini 3.6 Flash登場で見直す低コスト運用

AIの請求書を見て「先月こんなに使ったっけ」と思ったことはありませんか。チャットのサブスクが複数、APIの従量課金が別建て、気づけば月2〜3万円。副業やスモールビジネスの規模だと、これは利益をそのまま削る額です。
ところが2026年7月、その前提が少し変わりました。GoogleがGemini 3.6 Flashを発表し、性能を上げながら出力単価を下げてきたのです。AI代を下げる方法は「我慢する」だけではなくなりました。この記事では、値下げの中身と、副業・個人が今日から手を付けられる節約の順番を整理します。
AI代は「高いモデルを我慢する」より「使う場所を決める」だけで下がる
先に結論を書きます。月のAI代を圧縮する効果が大きい順に並べると、こうなります。
- 用途ごとにモデルを振り分ける(効果:大/手間:小)
- 使っていないサブスクを解約する(効果:大/手間:小)
- キャッシュと出力上限で無駄なトークンを削る(効果:中/手間:中)
- 軽い定型処理をローカルのAIに逃がす(効果:中〜大/手間:大・初期費用あり)
多くの人が3や4から手を付けますが、実際に効くのは1と2です。理由は単純で、高性能モデルと低コストモデルの単価差が5倍前後あるから。要約や分類のような軽い仕事をフラッグシップモデルに投げている限り、プロンプトをどれだけ削っても焼け石に水になります。
まずは「どの仕事をどのモデルに任せるか」を決める。その判断材料が、7月の値下げで大きく変わりました。
何が起きたのか:Gemini 3.6 Flashが「高性能なのに安い」を成立させた理由
Googleは米国時間2026年7月21日(日本時間7月22日)、Gemini 3.6 Flash・Gemini 3.5 Flash-Lite・Gemini 3.5 Flash Cyberの3モデルを発表しました。エージェント型のワークフローを想定した、高速・低コスト帯の強化です。
出力単価が$9.00から$7.50に下がった
主力のGemini 3.6 Flashは、Google Developer APIの標準料金で入力100万トークンあたり$1.50、出力$7.50。前世代のGemini 3.5 Flashは入力$1.50・出力$9.00でしたから、入力は据え置き、出力だけ約16.7%下がった形です。
新しい世代のモデルが前世代より安くなるのは、それほど当たり前のことではありません。同時期に一般提供が始まったOpenAIのGPT-5.6は、フラッグシップのSolがGPT-5.5と同じ価格帯を維持しており、「同じ価格でより高い性能」という方向でした。Googleは価格そのものを下げにきた、という違いがあります。
単価より効くのは「出力トークン17%削減」
ただし、単価表だけを見ると本質を取り逃がします。Googleは3.6 Flashについて、3.5 Flashと比べて出力トークンの使用量が平均17%減ったと説明しています。DeepSWEのような長時間のエンジニアリング系ベンチマークでは、最大65%の削減という数字も出ています。
ここが実務では大きい。請求額は「単価 × 使ったトークン数」で決まるので、単価が16.7%下がったうえに必要なトークン数まで減れば、掛け算で効いてきます。同じ仕事を同じプロンプトで回した場合、表の単価差以上に月額が下がる可能性がある、ということです。
もっとも、この削減幅はタスクに依存します。ベンチマークほどの削減が自分のワークロードで再現するとは限らないので、切り替えたら1週間ほど実データで請求額を見比べるのが確実です。
同時発表の2モデルは立ち位置が違う
- Gemini 3.5 Flash-Lite:入力$0.30・出力$2.50。毎秒350トークンという生成速度で、大量処理・検索・文書処理向け。3.6 Flashのおよそ1/5〜1/3の単価です
- Gemini 3.5 Flash Cyber:脆弱性の発見・修正に特化したセキュリティモデル。政府機関と信頼できるパートナーにのみ提供され、一般ユーザーは使えません
低価格モデル比較:どれを日常使いにするか
副業・個人が実際に選択肢に入れられる低〜中価格帯を並べます(100万トークンあたり/2026年7月時点)。
| モデル | 入力 | 出力 | 得意な仕事 |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 大量処理、分類、検索、文書処理 |
| GPT-5.6 Luna | $1.00 | $6.00 | 要約、下書き、定型処理、低レイテンシ応答 |
| Gemini 3.6 Flash | $1.50 | $7.50 | コーディング、マルチモーダル、複数ステップのエージェント |
| GPT-5.6 Terra | $2.50 | $15.00 | 日常業務全般(前世代最上位級の性能) |
| GPT-5.6 Sol | $5.00 | $30.00 | 難易度の高い設計・分析 |
※料金は執筆時点のもので、改定される場合があります。最新の単価は各社の公式料金ページをご確認ください。
読み方のコツを3つ。
入力と出力の比率を見る。 出力単価は入力の5〜6倍です。長い資料を読ませて短く答えさせる仕事(要約・抽出)は入力寄りなので安く済み、逆に短い指示から長文を書かせる仕事は出力寄りで高くつきます。「単価が安いモデル」ではなく「自分の使い方で安くなるモデル」を選ぶことになります。
思考トークンも出力として課金される。 Gemini 3.6 Flashでは、thinking tokenが出力トークンの料金で課金されます。画面に出てきた回答が短くても、内部で長く考えていれば請求は増えます。見た目の文字数で見積もると外れます。
キャッシュ単価は別枠。 Gemini 3.6 Flashのコンテキストキャッシュは100万トークンあたり$0.15。同じ長いシステムプロンプトや資料を毎回送っているなら、ここが効きます。
【独自】用途別・振り分けルール5つ
「使い分けましょう」で終わる記事は多いのですが、判断基準がないと結局いつもの1つに戻ります。私が実務で使っている振り分けルールを、そのまま書き出します。
1. やり直しコストが低い仕事は最安モデル
タイトル案の生成、タグ付け、メール文の下書き、記事の分類。失敗しても捨てて再実行すれば済む仕事は、Flash-LiteやLunaで十分です。10回試して1回当たればいい種類の作業に、高いモデルを使う理由がありません。
2. 判断が後続に波及する仕事は上位モデル
設計の相談、契約書のリスク洗い出し、事業判断の壁打ち。ここで間違えると、後工程の手戻りが人件費として跳ね返ります。月に数回しか発生しないので、単価が高くても総額への影響は小さい。ケチる場所ではありません。
3. 出力が長い仕事ほどモデルを下げる
出力単価が入力の5倍以上ある以上、長文を書かせる作業は単価差がそのまま増幅されます。「1万字のドラフトを書かせて、自分で直す」のほうが、「上位モデルに完璧な5千字を書かせる」より安く済むことが多いです。
4. 繰り返し回すものはキャッシュ前提で組む
毎回同じマニュアルや商品データベースを添付しているなら、キャッシュに載せる設計に変える。1回だけの相談なら気にしなくて構いません。回数が多いものだけ手を入れます。
5. 常時稼働のエージェントは別会計で見る
これが一番危ない項目です。人が指示を出すチャット利用は、使った実感と請求額がだいたい一致します。ところが自動で回り続けるエージェントは、寝ている間もトークンを消費します。月額の想定上限を決めて、超えたら止まる仕組みを先に作ってください。
月のAI代を下げる実務テク4選
ルールが決まったら、あとは作業です。
棚卸し表を1枚作る
サービス名/月額または従量/実際に先月いくら使ったか/代替できるか、の4列で書き出します。これだけで「解約していい行」が2〜3個は見つかります。チャットのサブスクを3社契約していて、実際は1社しか開いていない、というのはよくある話です。
出力上限を設定する
APIを叩くコードを書いているなら、max_tokensを実際に必要な長さに絞る。「念のため大きめ」にしておくと、モデルが律儀に長文を返してきて課金されます。
バッチ処理に回せるものを分ける
即答が要らない処理(夜間の一括要約、記事のリライトなど)は、各社が用意している低優先度の処理枠に回すと単価が下がります。急がない仕事を急いで処理させない、というだけの話ですが効きます。
定型処理をローカルに逃がす
ここまでの3つを実施してもまだ従量課金が重い場合、手元のマシンでAIを動かすという選択肢が出てきます。文字起こしの整形、社内文書の分類、大量のテキスト変換といった「賢さより回数」の仕事は、ローカルで動く小さなモデルでも実用に足ります。動かした分だけ課金される構造から抜けられるので、処理量が多い人ほど差が開きます。
問題は、ローカルLLMを動かすにはそれなりのメモリとAI処理性能を積んだPCが要ることです。ここで選択肢に入るのがミニPCで、GMKtec(ミニPC)はAMD Ryzen AI Max+ 395のような最新AIチップに対応したモデルを揃えており、ローカルLLMやデータ分析の用途を想定した製品ラインを持っています。世界70ヵ国以上・累計1億台以上の販売実績があるブランドで、1年保証・7日間返品対応・24時間365日の技術サポートが付きます。価格帯は約23,000円〜315,000円と幅が広く、用途に応じて選べます。
デスクの上を占領しないサイズで24時間動かしておけるので、「夜間にバッチ処理を回して朝に結果を受け取る」という運用とも相性が良い構成です。
乗り換え判断のポイントと、乗り換えない方がいい人
正直に書きます。全員が得をする話ではありません。
乗り換える価値が高い人
- 月のAI関連支出が1万円を超えている
- APIを使った自動処理を日常的に回している
- 要約・分類・下書きなど、軽い作業の比率が高い
- 出力が長いタスク(記事生成、コード生成)が中心
急いで動かなくていい人
- 月額課金のチャットサービス1つで完結していて、従量課金がない
- AIを使うのが週に数回で、月額数千円に収まっている
- 品質の差が売上に直結する仕事(提案書、クライアント納品物)が中心
ローカルLLM(ミニPC導入)が向いていない人
これは特にはっきり書いておきます。初期費用が数万円〜かかるうえ、環境構築の手間があり、ローカルで動く小型モデルの回答品質はクラウドの最新モデルには届きません。月のAI代が3,000円程度の人が元を取るのは難しいと考えてください。処理量が多く、かつ品質より回数が重要な仕事を抱えている場合に限って検討する話です。逆に、そこに当てはまるなら、従量課金の変動リスクから降りられる価値は小さくありません。
GMKtec(ミニPC)は7日間の返品対応があるので、手元の処理を実際に流してみて判断する余地はあります。購入前に、自分が動かしたいモデルのメモリ要件と製品のスペックが合っているかは確認してください。
※価格・仕様・キャンペーン内容は変動します。最新情報は公式サイトをご確認ください。
よくある質問
Q. Gemini 3.6 Flashは前のバージョンより高いですか?
いいえ。出力単価は100万トークンあたり$7.50で、3.5 Flashの$9.00より下がっています。入力単価$1.50は据え置きです(2026年7月時点)。
Q. Gemini 3.6 Proは出ていますか?
出ていません。「Gemini 3.6」として正式公開されているのはFlashのみです。上位のGemini 3.5 Proはパートナーとの検証段階にあります。
Q. Gemini 3.5 Flash Cyberは使えますか?
一般提供されていません。政府機関と信頼できるパートナーに限定されたセキュリティ特化モデルです。
Q. サブスクとAPI、どちらが安いですか?
使い方によります。人が画面に向かって対話する用途は月額サブスクのほうが読みやすく、プログラムから自動で叩く用途はAPIのほうが安く済むケースが多いです。両方契約している場合、どちらかが遊んでいる可能性があるので棚卸しをおすすめします。
Q. モデルを切り替えるとき、コードの変更は必要ですか?
モデル名の変更だけで動くこともありますが、API互換性の確認は必要です。切り替え後は出力の品質と請求額を1〜2週間並走させて確認するのが安全です。
まとめ
Gemini 3.6 Flashの登場で、「新しいモデルは高い」という前提は崩れました。出力単価$9.00→$7.50の値下げに加えて、同じ仕事に必要な出力トークンが平均17%減っている。この2つが掛け算で効くぶん、単価表を眺めているだけでは見えない差が出ます。
やることは3つです。用途ごとにモデルを振り分ける、使っていないサブスクを切る、処理量が多いなら手元で回すことを検討する。1つ目と2つ目は今日中に終わります。まずは先月の請求明細を開くところから始めてください。






