スキップしてメイン コンテンツに移動

投稿

ラベル(Gemini 3.5 Flash)が付いた投稿を表示しています

コードを「書く」AIから「実行する」エージェントへ:Google AntigravityとGemini 3.5 Flashが拓くエージェント開発の時代

2026年7月現在、Google(グーグル)の技術トレンドを貫くキーワードを一つ挙げるなら、間違いなく**「エージェント(Agent)」 です。5月のGoogle I/O 2026で公開された Gemini 3.5 Flash**、エージェントファーストの開発プラットフォーム Antigravity 2.0 、そして映像ベースの生成モデル Gemini Omni まで——Googleが放ったメッセージは明確です。AIはもはやコードを「補助的に書く」副操縦士(Co-pilot)を超え、自ら作業を「実行する」自律エージェントへと移行しています。 本記事では、開発者・技術実務者の視点から、Googleが最近発表した主要技術が実際の開発ワークフローをどう変えているのかを、根拠とともに整理します。 1. Gemini 3.5 Flash:「安くて速い」ティアが旧フラッグシップを超えた 今回の発表で最も象徴的な出来事は、 低価格・高速ティアであるGemini 3.5 Flashが、旧フラッグシップのGemini 3.1 Proをコーディング・エージェントのベンチマークで上回った ことです。Googleはこれを「行動するフロンティア知能(frontier intelligence with action)」と表現しました。 公開されたベンチマーク数値は次の通りです。 Terminal-Bench 2.1: 76.2% — ターミナル環境での実際のコーディング遂行能力 GDPval-AA: 1656 Elo — 実務型エージェントタスクの遂行能力 MCP Atlas: 83.6% — ツール呼び出し(tool-use)およびMCP連携性能 重要なのは単にスコアが高いことではなく、**「他のフロンティアモデルの約4倍の速度で、半分以下のコスト」**でこの性能を出す点です。エージェントは一つの作業を完遂するために、数十〜数百回の推論・ツール呼び出しを繰り返します。したがって「速度 × コスト」はエージェントワークフローの実用性を決める絶対的な変数であり、3.5 Flashはまさにこの点を狙い撃ちしました。 実務インサイト: これからは「最も賢いモデル」ではなく「十分に賢く、反復実行に負担のないモデル」がエージェントアーキテクチャの既定値になります。パ...

【AIの豆知識】Gemini 3.5 Flash vs 3.1 Pro、トークンがあっという間に溶ける理由と賢いモデル選択ガイド

【AIの豆知識】Gemini 3.5 Flash vs 3.1 Pro、トークンがあっという間に溶ける理由と賢いモデル選択ガイド こんにちは!最近、Googleの次世代AIラインナップである Gemini 3.5 Flash と Gemini 3.1 Pro を使ってみて、「あれ?なんでこんなにトークン(コスト)がすぐに消えちゃうの?」と慌てた方も多いのではないでしょうか。 少し質問しただけなのにトークン制限に引っかかったり、高額な請求が来たりする泣きたくなる状況…。一体なぜこんなことが起こるのか、そして お財布を守りながらAIの効率を最大化するモデルやオプションの選択基準 を総まとめします! 1. 私のトークンはどこへ?犯人は「Thinkingモード」 Google Gemini 3.xラインナップの最強の武器は、ズバリ「内蔵型の高度な推論(Thinking)機能」です。これは、AIが最終的な答えを出す前に、内部で深く考える段階を経るというものです。 ここに落とし穴があります。 AIが内部で頭をフル回転させながら使った独り言(推論トークン)が、すべて「出力(Output)トークン使用量」に含まれて計算される という点です! Thinking (High) モードの恐ろしさ: ユーザーが1行の質問を投げただけでも、AIは完璧な答えを出すためにバックグラウンドで独自にエージェントループを回し、何万ものトークンを消費してしまいます。見た目は短い回答でも、実際には莫大なトークンが消費されている元凶なのです。 拡大された出力ウィンドウ: Gemini 3.5 Flashは、一度に出力できる上限が 65,536トークン へと大幅に増加しました。モデルが長文を書いたり、深く考え始めたりすると、たった1回の会話でトークンが空っぽになってしまいます。 2. Geminiモデル別「Thinkingレベル」によるトークン消費量の比較 すべてのモデルの最大入力は100万トークン、最大出力は65,536トークンで同じですが、 Thinkingの設定によって内部トークンの配分が完全に変わります。 比率と体格が異なる3つの設定( 3.5 Flash - Medium 、 3.1 Pro - Low 、 従来の3 Flash - High )のトークン使用量を明...

【AIの豆知識】Gemini 3.5 Flash vs 3.1 Pro、トークンがあっという間に溶ける理由と賢いモデル選択ガイド

【AIの豆知識】Gemini 3.5 Flash vs 3.1 Pro、トークンがあっという間に溶ける理由と賢いモデル選択ガイド こんにちは!最近、Googleの次世代AIラインナップである Gemini 3.5 Flash と Gemini 3.1 Pro を使ってみて、「あれ?なんでこんなにトークン(コスト)がすぐに消えちゃうの?」と慌てた方も多いのではないでしょうか。 少し質問しただけなのにトークン制限に引っかかったり、高額な請求が来たりする泣きたくなる状況…。一体なぜこんなことが起こるのか、そして お財布を守りながらAIの効率を最大化するモデルやオプションの選択基準 を総まとめします! 1. 私のトークンはどこへ?犯人は「Thinkingモード」 Google Gemini 3.xラインナップの最強の武器は、ズバリ「内蔵型の高度な推論(Thinking)機能」です。これは、AIが最終的な答えを出す前に、内部で深く考える段階を経るというものです。 ここに落とし穴があります。 AIが内部で頭をフル回転させながら使った独り言(推論トークン)が、すべて「出力(Output)トークン使用量」に含まれて計算される という点です! Thinking (High) モードの恐ろしさ: ユーザーが1行の質問を投げただけでも、AIは完璧な答えを出すためにバックグラウンドで独自にエージェントループを回し、何万ものトークンを消費してしまいます。見た目は短い回答でも、実際には莫大なトークンが消費されている元凶なのです。 拡大された出力ウィンドウ: Gemini 3.5 Flashは、一度に出力できる上限が 65,536トークン へと大幅に増加しました。モデルが長文を書いたり、深く考え始めたりすると、たった1回の会話でトークンが空っぽになってしまいます。 2. Geminiモデル別「Thinkingレベル」によるトークン消費量の比較 すべてのモデルの最大入力は100万トークン、最大出力は65,536トークンで同じですが、 Thinkingの設定によって内部トークンの配分が完全に変わります。 モデルと設定 (Thinking Level) 脳の稼働率 (推論の深さ) 平均的な内部推論トークン消費 特徴と体感 Gemini 3.5 Fl...