AI MODEL SELECTION / API COMPARISON

AIエージェント向け
モデル・能力・費用の比較

Claude Sonnet 5、GPT-5.6 Terra、Gemini 3.8 Flashを主力候補として比較し、安価な処理用にGPT-5.6 Lunaを加える構成をおすすめします。

難しい仕事をどこまで任せるかによって、上位モデルを追加すると選びやすくなります。中国企業5社(DeepSeek・Alibaba・Moonshot AI・Z.ai・MiniMax)を含む、10社・18モデルの比較です。月額チャット契約の料金ではありません。

中国企業モデルの選び方・料金条件へ ↓

情報確認日:2026年9月15日 | 対象:APIで組み込むエージェント | 通貨:米ドル(USD)

📅 作成: 2026-09-15 / 更新: 2026-09-16

会社・モデル・費用の比較

料金は100万トークンあたり。トークンは文章を処理する単位で、日本語の文字数とは一致しません。

「試算」は1タスクの全呼び出し合計が入力10万+出力1万トークンの場合。通常の非キャッシュ料金で、検索・実行環境などの費用は含みません。緑色の行は最初に試す候補です。

提供会社モデル入力料金出力料金1タスク試算エージェントでの位置づけ・用途
OpenAIGPT-6 Astra$10$50$1.50難しい推論、複雑な開発、ブラウザーや業務ソフトをまたぐ作業
OpenAIGPT-5.6 Sol$4$20$0.60複雑な業務・開発を担当する上位候補
OpenAIGPT-5.6 Terra$2$12$0.32能力と費用のバランスを取る主力候補
OpenAIGPT-5.6 Luna$0.20$1.20$0.032大量処理、分類、抽出、限定された手順の実行
AnthropicClaude Fable 5.1$10$50$1.50難しい推論、多段階にわたる長時間の作業
AnthropicClaude Opus 5$5$25$0.75複雑なコーディング・企業業務
AnthropicClaude Sonnet 5$2$10$0.30速度と能力を両立させる主力候補
AnthropicClaude Haiku 4.5$1$5$0.15速度重視の軽作業
GoogleGemini 3.8 Flash$0.75$3.75$0.1125開発・業務自動化、画像・音声・動画を含む処理
xAI/SpaceXAIGrok 4.6$2$6$0.26ツール実行、コーディング、X検索を組み込む調査
DeepSeek(中国)DeepSeek-V4.1-Flash$0.15〜0.30$0.60〜1.20$0.021〜0.042低コストのツール実行・画像理解を評価する候補
Mistral AIMistral Medium 3.5$1.50$7.50$0.225エージェント・コーディング向けの比較候補
Mistral AIMistral Small 4$0.15$0.60$0.021安価な推論・コード処理、自社運用も検討する候補
Alibaba/阿里巴巴(中国)Qwen3.8-Max
Alibaba Cloud・Singapore / International
$2$6$0.26画像・動画も扱う汎用エージェント、開発・オフィス業務。料金
Moonshot AI/月之暗面(中国)Kimi K3
Alibaba Cloud経由・Singapore / International
$3$15$0.45大規模コードベース、長時間の開発・知識作業。料金
Z.ai/智譜(中国)GLM-5.3
Z.ai General API
$1.40$4.40$0.184複雑な開発・ツール実行。テキスト入力のみ、推論は常時有効。料金
Z.ai/智譜(中国)GLM-5.3-Flash
Z.ai General API
$0.15$0.50$0.020画像理解を含む低コストの開発・エージェント処理。料金
MiniMax(中国)MiniMax-M3
MiniMax API・Standard/入力512K以下
$0.30$1.20$0.042低コストのコーディング、画像・動画理解、ツール実行。料金

公式情報: OpenAIAnthropicモデル一覧料金GoogleGrokDeepSeekMistral料金モデル一覧

価格の補足

エージェントとしての能力の違い

公式仕様から整理した選定上の見立てです。同じ環境で実測した性能ランキングではありません。

系列ツール・外部操作長い文脈の扱い選ぶ理由
OpenAI GPT関数実行、Web検索、ファイル検索、画面操作に対応表の4モデルは約105万トークンファイル・ブラウザー・コードを扱う汎用エージェントを構成しやすい
Anthropic Claude現行モデルはツール利用・画像理解に対応Fable/Opus/Sonnetは100万、Haikuは20万難しい仕事と日常処理でモデルを使い分けやすい
Gemini 3.8 Flash関数実行、コード実行、検索、画面操作プレビュー入力約105万トークン音声・動画・画像・PDFを一つのモデルに入力できる
Grok 4.6関数実行、Web/X検索などを組み合わせる50万トークンXを情報源にした調査を組み込む場合に特徴がある
DeepSeek-V4.1-Flashツール実行、JSON出力、画像理解。OpenAI/Anthropic形式のAPIに対応100万トークンAPI費用と既存実装への接続性を重視する場合
MistralMedium 3.5はエージェント・開発向け、Small 4は推論・コード処理を統合個別モデル仕様で確認API利用に加え、公開モデルの自社運用も検討する場合
Qwen3.8-MaxFunction Calling、構造化出力、画像・動画入力最大入力991,808トークン(思考時983,616)Alibaba Cloudを利用した開発・オフィス業務。公式仕様
Kimi K3ネイティブ画像理解、長い工程のコーディング・推論100万トークン大規模リポジトリーや長時間の知識作業を評価。公式仕様公式発表
GLM-5.3Function Calling、JSON等の構造化出力。テキスト専用100万トークン、最大出力128K複雑なソフトウェア開発の比較候補。推論を無効化できない。公式仕様
GLM-5.3-Flashネイティブ画像理解、開発・エージェント用途。MITライセンスでモデル公開100万トークン級低コストのAPI運用と自社ホスティングを比較。公式モデルカード
MiniMax-M3ツール実行、テキスト・画像・動画入力。Anthropic形式のAPIに対応100万トークン低コストで長い開発タスクを評価。互換APIの対応項目は個別確認。公式仕様

仕様出典: OpenAIClaudeGemini 3.8 FlashGrokDeepSeekMistral Medium 3.5Small 4

文脈上限が大きいことと、長時間の仕事を正しく完遂できることは別の評価項目です。モデルにツール利用能力があっても、実際の操作にはエージェント側の実装が必要です。

最初に試す4モデル

主力候補

Claude Sonnet 5

日常の開発・業務作業を、速度と品質のバランスよく処理できるか。

主力候補

GPT-5.6 Terra

同じ仕事でSonnetより完遂率やツール操作が良くなるか。

費用・多様な入力

Gemini 3.8 Flash

低い費用で必要品質を満たせるか。画像・音声・動画にも対応できるか。

安価な処理用

GPT-5.6 Luna

分類・抽出・定型作業を安価に任せられるか。

難しいタスクが残れば、GPT-6 AstraまたはClaude Opus 5を追加して評価します。X中心の調査ならGrok、コストをさらに下げたいならDeepSeek/Mistralを追加する順序を提案します。

費用は「成功1件あたり」で比較する

エージェントは何度もモデルを呼び出すため、単価だけでは実際の安さが分かりません。

成功1件あたりの費用 = 再試行・ツール料金を含む総費用 ÷ 成功件数

実際に任せたい仕事を20〜30件用意し、次の4点を記録すると選定しやすくなります。

最初の選定では「主力1モデル+安価な処理用1モデル」を目指すのが扱いやすい構成です。上の4候補を同じ日本語の実務タスクで比べれば、能力と費用の両面から絞れます。

中国企業のモデルを含めた選び方

既掲載のDeepSeekに加え、Qwen3.8-Max、Kimi K3、GLM-5.3、GLM-5.3-Flash、MiniMax-M3の5モデルを追加しました。以下は公式仕様・価格からの選定案で、同一タスクで測定した性能順位ではありません。

低コストの比較候補

GLM-5.3-Flash/MiniMax-M3

GPT-5.6 Lunaと同じ実務タスクで、ツール実行の成功率・画像理解・総費用を比べます。今回の使用量例ではそれぞれ$0.020/$0.042です。

主力の比較候補

Qwen3.8-Max/GLM-5.3

Sonnet 5・Terraとの比較対象にします。画像・動画入力も必要ならQwen、テキスト中心の複雑な開発ならGLM-5.3を評価します。

長時間の開発・知識作業

Kimi K3

大規模リポジトリーの変更や、長い工程を自律的に進める仕事の候補です。今回の価格条件ではSonnet 5より高いため、完遂率や再試行の減少で費用差を回収できるかを確認します。

既存の低価格候補

DeepSeek-V4.1-Flash

低価格モデルの比較基準として引き続き有効です。時間帯別の料金を含めて、実際の運用時間で費用を比べます。

追加モデルの料金条件

比較の進め方:元の主力候補にQwen3.8-MaxまたはGLM-5.3を1つ、低価格候補にGLM-5.3-FlashまたはMiniMax-M3を1つ追加して評価するのがおすすめです。日本語の指示理解・成果物品質も同じ課題で確認してください。

中国企業が開発したモデルという分類と、APIの提供事業者・データの処理地域は別です。公開モデルを自社で運用する場合、この表のAPI単価ではなくGPU・ホスティング・運用費で比較します。