
最適なコンテンツモデレーションAPI:テキスト・画像・動画で比較
用途別に最適なコンテンツモデレーションAPIを選ぶ:OpenAI、Azure、AWS、Google、Hive、Sightengine、Mistralをモダリティ、カテゴリ、課金、無料枠、セルフホストで比較。
最適なコンテンツモデレーションAPIを決めるのは、精度の宣伝文句よりも4つの単純な事実です。どのメディアを読めるか、どのカテゴリを返すか、どう課金するか、そして自前で動かせるか。OpenAIの omni-moderation-latest は無料でテキストと画像を読めますが[1][2]、画像に適用されるのは13カテゴリのうち6つだけで、音声は分類しません[2]。Amazon Rekognitionは動画を分単位でモデレーションします[3]。Mistralはマルチモーダルなモデレーションモデルのオープンウェイトを公開しています[4]。選定を左右するのは、どのベンチマークよりもこうした違いです。
この比較では11の選択肢を取り上げ、それぞれ2026年10月にベンダー自身のドキュメントと料金ページで確認しました。扱うのは各APIのカバー範囲と課金方法です。項目ごとの具体的な料金と試算例はOpenAIのModeration APIは無料?をご覧ください。
TL;DR
- 低予算でテキストと画像: OpenAIのモデレーションエンドポイント。OpenAI API利用者は無料、13カテゴリ[1][2]。
- PIIとジェイルブレイク検出付きのテキスト: Mistral Moderation 2。無料と表示、テキスト11カテゴリ[5][6]。
- 動画: Amazon Rekognition(保存済み動画とストリーミング動画、分単位課金)またはSightengine(有料プランで動画、Proでライブ配信)[3][7]。
- 細かな画像ラベル: 10のトップレベルカテゴリを持つRekognitionの3階層タクソノミー、またはSightengineの120以上の画像クラス[8][7]。
- セルフホスト: MistralのShieldstral 1.0(Apache 2.0のウェイト、パブリックプレビュー)またはコミットメントプランのAzure切断コンテナー[4][9]。
- 新規開発では避ける: Perspective API。2026年12月31日以降はサービスが終了します[10]。
コンテンツモデレーションAPIの違いはどこにあるか
ほとんどのモデレーションAPIは同じ種類の答えを返します。カテゴリの集合と、それぞれのスコアまたは重大度です。本番運用で効いてくる違いは別のところにあります。
モダリティ。 テキスト専用APIはアップロードされた写真には役に立たず、画像APIはキャプションを読みません。動画はさらに少なく、以下の選択肢のうち動画モデレーションを掲げているのはAmazon Rekognition、Sightengine、Hiveだけで、Hiveは問い合わせフォーム経由で有効化します[3][7][11]。
カテゴリ設計。 OpenAIは13の有害カテゴリを真偽値と0〜1のスコアで返します[2]。Azureは4カテゴリ(ヘイト、性的、暴力、自傷)を返し、重大度はテキストが0〜7、画像が0・2・4・6です[12]。Google Natural Languageは16の属性を返し、そのうちHealth、Finance、Politics、Legalなどいくつかは有害というよりセンシティブな話題です[13]。自社ポリシーの書き方に合う設計を選んでください。
課金単位。 ベンダーが数えるのは文字数、テキストレコード、リクエスト、画像、分、あるいは「オペレーション」で、単位によって安く済む入力が変わります。50文字のコメントはHiveでは1リクエストですが、Amazon Comprehendでは300文字として課金されます[11][14]。各単位の説明は料金比較にあります。
どこで動くか。 ホスト型APIはすべて、ユーザーのコンテンツを第三者に送ります。それが許されないなら、候補はダウンロード可能なウェイトやコンテナーがある選択肢に絞られます。
最適なコンテンツモデレーションAPIの比較表
| API | テキスト | 画像 | 動画 | カテゴリ | 課金単位 | 無料利用 | セルフホスト |
|---|---|---|---|---|---|---|---|
OpenAI omni-moderation-latest | 対応 | 対応(13カテゴリ中6つ) | 記載なし | 有害カテゴリ13、スコア0〜1[2] | なし(無料) | 無料、レート制限内[1] | 不可 |
| Azure AI Content Safety | 対応 | 対応 | 記載なし | 4カテゴリ、重大度0〜7[12] | テキストレコード(1,000文字)、画像 | 毎月テキストレコード5,000件+画像5,000枚[9] | 切断コンテナー、年間コミットメント[9] |
| Amazon Rekognition | 非対応 | 対応 | 対応 | 3階層タクソノミー、トップレベル10[8] | 画像、動画の分 | 12か月間、毎月画像1,000枚+動画60分[3] | 不可 |
| Amazon Comprehend 有害性検出 | 英語のみ | 非対応 | 記載なし | ラベル7種[15] | 100文字、最低3単位 | 無料枠の対象リスト外[14] | 不可 |
| Google Cloud Vision SafeSearch | 非対応 | 対応 | 記載なし | 5つの尤度:adult、spoof、medical、violence、racy[16] | 画像 | 毎月1,000ユニット[17] | 不可 |
| Google Natural Language Text Moderation | 対応 | 非対応 | 記載なし | 属性16、信頼度0〜1[13] | 100文字 | 毎月50,000ユニット[18] | 不可 |
| Hive | 対応 | 対応 | 問い合わせフォーム経由 | 料金ページに記載なし | リクエスト、音声は分単位 | 支払い方法の登録で$50+のクレジット[11] | 不可 |
| Sightengine | 対応 | 対応(120以上のクラス) | 対応、ライブ配信はPro | 画像クラス120以上[7] | オペレーション | 毎月2,000オペレーション[7] | 不可 |
| Mistral Moderation 2 | 対応 | 非対応 | 記載なし | 11(PIIとジェイルブレイクを含む)[6] | なし(無料) | 無料と表示[5] | 不可 |
| Mistral Shieldstral 1.0 | 対応 | 対応 | 記載なし | 自分で書くはい/いいえのポリシー質問[4] | 自社ハードウェア | オープンウェイト | 可、Apache 2.0 |
| reAPI Content Moderation | 対応 | 対応(画像URL) | 非対応 | omni-moderation-latest と同じ13[19] | テキスト1,000語または画像1枚 | 有料 | 不可 |
音声は別のニーズです。OpenAIのモデルは音声を分類しません[2]。Hiveは音声モデレーションを分単位で課金し、SightengineはProプランに含めています[11][7]。
用途別に最適なコンテンツモデレーションAPIを選ぶ
チャット、コメント、LLMのプロンプト
チャットアプリ、コメント欄、LLMパイプラインのテキストなら、無料の選択肢から始めましょう。OpenAIのエンドポイントは嫌がらせ、ヘイト、違法行為、自傷、性的、暴力の各ファミリーとサブカテゴリをカバーし[2]、Responses APIならモデルの入力と出力のモデレーションスコアを同じ呼び出しで受け取れます[2]。Mistral Moderation 2はOpenAIにないカテゴリを加えます。PII、ジェイルブレイク、そして個別の医療・金融・法律アドバイスの要求です[6]。プロンプトインジェクションや個人情報を引き出そうとするユーザーが心配なら、こちらのリストのほうが合っています。
確率ではなく段階的な重大度が欲しい場合や、カスタムカテゴリ(プレビュー)を定義したい場合はAzureを選びます[12][20]。AzureのContent Safetyモデルは8言語で学習・テストされており、それ以外の言語でも動作しますが品質にはばらつきがあります[20]。Amazon Comprehendの有害性検出は英語のみです[15]。
ユーザーがアップロードした画像
汎用モデルは画像に弱めです。OpenAIが画像に適用するのは自傷、性的、暴力のファミリーだけで、嫌がらせ、ヘイト、違法行為はテキスト専用です[2]。Azureは4カテゴリすべてを画像にも適用します[12]。
水着、アルコール、ギャンブル、薬物、下品なジェスチャー、ヘイトシンボルといった項目がポリシーにあるなら、画像に特化したサービスを使いましょう。Rekognitionはこれらをトップレベルカテゴリとして持ち[8]、Sightengineは120以上の画像クラスを掲げています[7]。画像入力、しきい値、コードについては画像モデレーションAPIガイドで詳しく扱っています。
動画とライブ配信
RekognitionはAmazon S3の保存済み動画とストリーミング動画イベントを分析し、処理した分数で課金します[3]。SightengineはStarterで50 MBまで、Proで500 MBまでの動画ファイルとライブ配信に対応します[7]。Hiveは問い合わせフォームで動画を有効化した後、指定したサンプリング頻度でフレームを抽出します[11]。
自社インフラの外に出せないデータ
MistralのShieldstral 1.0は、Apache 2.0で公開された38億パラメータのモデルで、自然言語で書いたポリシー質問に照らしてテキストと画像の入力を分類し、コンテキストは32kトークンです。現在はパブリックプレビューです[4]。AzureはContent Safetyを、数億レコード規模の年間コミットメント枠で切断コンテナーとして販売しており[9]、小規模チームよりも大企業向けです。
すでにPerspective APIを使っている場合
JigsawはPerspectiveを終了します。サービスは2026年12月31日まで稼働し、新規の利用・クォータ申請は2026年2月までしか受け付けられず、移行支援もありません[10]。今のうちに移行を計画してください。有害性タイプの属性が必要なら、Google Natural Language Text Moderationは16の属性の中でToxic、Insult、Profanityを返します[13]。
reAPIで生成とモデレーションを並べて使う
すでにreAPIで画像・動画・テキストを生成しているなら、Content Moderationは同じキー、同じクレジット残高、同じタスク契約で omni-moderation-latest を実行します。非同期で、/api/v1/moderations に送信してからタスクをポーリングします[21]。OpenAIの同期レスポンスとは異なるため、OpenAI SDKの統合をそのまま置き換えることはできません。課金はモデレーションユニット単位で、現在の料金はモデルページにあります[19]。
OpenAIのModeration APIで十分か
この問いは開発者フォーラムからそのまま来ており、答えは「多くのテキスト用途では十分」です。無料で、13カテゴリをカバーし、文字列のバッチも受け付けます[1][2]。制限はドキュメント化されているので、自分のケースと照らし合わせられます。
- 7つのカテゴリは画像を見ないため、画像中心のプラットフォームでは部分的なカバーにとどまります[2]。
- 音声は分類せず、OpenAIが記載している入力はテキストと画像だけです[2]。
- OpenAIはモデルを随時更新するため、
category_scoresに基づくしきい値は "may need recalibration" とされています[2]。 - CSAM検出用には設計されておらず、OpenAIはそうした素材を送らないよう求めています[2]。
- スループットは利用ティアで制限され、Freeティアでは1日5,000リクエストからです[22]。
どれにも引っかからなければ、これがデフォルトの選択です。どれかに引っかかるなら、上の表でその穴を埋めるAPIが分かります。
よくある質問
OpenAIのModeration APIで十分?
13カテゴリの範囲内のテキストモデレーションなら多くの場合十分で、費用もかかりません[1]。音声や動画が必要な場合、自傷・性的・暴力以外の画像チェックが必要な場合、PIIやジェイルブレイクのようなカテゴリが必要な場合は不足します[2][6]。
Azureのコンテンツモデレーション API
Azureの現在の製品はAzure AI Content Safetyで、Analyze TextとAnalyze Imageという別々のAPIがヘイト、性的、暴力、自傷を重大度レベル付きで評価します[20][12]。Prompt Shields、保護された素材の検出、カスタムカテゴリもあります[20]。無料ティアは毎月テキストレコード5,000件と画像5,000枚です[9]。
Googleのコンテンツモデレーション API
Googleはモデレーションを2つのAPIに分けています。画像向けのCloud Vision SafeSearch(5つの尤度カテゴリ)[16]と、テキスト向けのCloud Natural Language Text Moderation(16属性)です[13]。どちらにも毎月の無料枠があります[17][18]。
Amazon Rekognitionのコンテンツモデレーション API
Rekognitionは DetectModerationLabels で画像をモデレーションし、保存済み動画とストリーミング動画にも対応します[3]。ラベルは3階層のタクソノミーに従い、トップレベルはExplicitやViolenceからGamblingやHate Symbolsまで10カテゴリです[8]。AWSでテキストを扱うなら、Amazon Comprehendの有害性検出が別の英語専用の選択肢です[15]。
MistralのモデレーションAPI
Mistralは /v1/moderations で mistral-moderation-2603(Mistral Moderation 2)を提供しており、コンテキストは128kで、価格は無料と表示されています[5]。テキストをPIIやジェイルブレイクを含む11カテゴリで分類します[6]。オープンウェイトの兄弟モデルShieldstral 1.0は画像も読めます[4]。
動画モデレーションAPI
動画モデレーションを掲げているのはAmazon Rekognition、Sightengine、Hiveです。この比較に含まれるOpenAI、Azure Content Safety、Google、Mistralのモデレーションは、テキストまたは画像の入力しか記載していません[3][7][11]。テキストと画像に対応したAPIなら、自分でフレームを抽出して画像として送る方法があり、Hiveも自社の動画処理をそのように説明しています[11]。
最適な画像モデレーションAPI
アルコール、ギャンブル、ヘイトシンボルのようなラベルを含む幅広い画像ポリシーなら、RekognitionかSightengineです[8][7]。性的・暴力・自傷だけなら、OpenAIの無料エンドポイントも画像に対応します[2]。詳しくは画像モデレーションAPIガイドをご覧ください。
オープンソースのモデレーションAPI
MistralのShieldstral 1.0はApache 2.0のウェイトで公開され、テキストと画像を扱えます。現在はパブリックプレビューです[4]。Azureのモデルを自社インフラで動かしたい場合は、AzureがContent Safetyを年間コミットメントの切断コンテナーとして販売しています[9]。
自社スタックに最適なコンテンツモデレーションAPIを選ぶ
まず、チェックすべきメディアから考えます。テキストだけのプロダクトは、OpenAIの無料エンドポイントかMistral Moderation 2から始め、重大度レベルやカスタムカテゴリが必要になったらAzureに移れます。画像中心のプロダクトはラベルの細かさでRekognitionかSightengineを検討し、動画を含むならRekognition、Sightengine、Hiveに絞られます。コンテンツをサーバーの外に出せないなら、Shieldstralのオープンウェイトが現実的な道です。
残った候補の間では価格が決め手になることが多く、その数字はモデレーションAPIの料金比較にあります。他のreAPIモデルと同じ非同期の契約で omni-moderation-latest を使いたい場合は、Content Moderationのモデルページをご覧ください。いずれにせよ、最適なコンテンツモデレーションAPIとは、実際に運用するポリシーにカテゴリが合っているものです。
参考文献
- OpenAI. Is the Moderation endpoint free to use? 2026年10月に取得。 help.openai.com/en/articles/4936833-is-the-moderation-endpoint-free-to-use
- OpenAI. Moderation guide. 2026年10月に取得。 developers.openai.com/api/docs/guides/moderation
- Amazon Web Services. Amazon Rekognition pricing. 2026年10月に取得。 aws.amazon.com/rekognition/pricing
- Mistral AI. Shieldstral 1.0 model card. 2026年10月に取得。 docs.mistral.ai/models/shieldstral-1-0
- Mistral AI. Mistral Moderation 2 model card. 2026年10月に取得。 docs.mistral.ai/models/mistral-moderation-26-03
- Mistral AI. Moderation and guardrailing. 2026年10月に取得。 docs.mistral.ai/studio/conversations/moderation
- Sightengine. Pricing. 2026年10月に取得。 sightengine.com/pricing
- Amazon Web Services. Using the image and video moderation APIs, Amazon Rekognition Developer Guide. 2026年10月に取得。 docs.aws.amazon.com/rekognition/latest/dg/moderation-api.html
- Microsoft Azure. Content Safety pricing. 2026年10月に取得。 azure.microsoft.com/en-us/pricing/details/content-safety
- Jigsaw. Perspective API sunset announcement. 2026年10月に取得。 perspectiveapi.com
- Hive. Pricing. 2026年10月に取得。 thehive.ai/pricing
- Microsoft Learn. Harm categories in Azure AI Content Safety. 2026年10月に取得。 learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/harm-categories
- Google Cloud. Moderate text, Cloud Natural Language API. 2026年10月に取得。 docs.cloud.google.com/natural-language/docs/moderating-text
- Amazon Web Services. Amazon Comprehend pricing. 2026年10月に取得。 aws.amazon.com/comprehend/pricing
- Amazon Web Services. Trust and safety, Amazon Comprehend Developer Guide. 2026年10月に取得。 docs.aws.amazon.com/comprehend/latest/dg/trust-safety.html
- Google Cloud. Detect explicit content (SafeSearch). 2026年10月に取得。 docs.cloud.google.com/vision/docs/detecting-safe-search
- Google Cloud. Cloud Vision API pricing. 2026年10月に取得。 cloud.google.com/vision/pricing
- Google Cloud. Cloud Natural Language pricing. 2026年10月に取得。 cloud.google.com/natural-language/pricing
- reAPI. Content Moderation model page. reapi.ai/models/content-moderation
- Microsoft Learn. What is Azure AI Content Safety? 2026年10月に取得。 learn.microsoft.com/en-us/azure/ai-services/content-safety/overview
- reAPI. Content Moderation API docs. reapi.ai/docs/content-moderation
- OpenAI. omni-moderation model page. 2026年10月に取得。 developers.openai.com/api/docs/models/omni-moderation-latest
著者

カテゴリ
他の記事

Grok Imagine 2.0対GPT Image 2:スコア・編集
Grok Imagine 2.0はArena両部門でGPT Image 2の次位だが、APIはまだ未公開。Elo差と領域編集、現在使えるモデルを解説します。


Nano Banana 2.1 API 料金:1K・2K・4K の1枚あたりの価格
Nano Banana 2.1 API の料金を解説。Google 公式の1K・2K・4K の画像1枚あたりのコスト、Nano Banana 2 や Pro との価格比較、1枚定額で使える選択肢を紹介します。


Kling Motion Control:v2.6 vs v3、料金と準備
Kling Motion Control v2.6またはv3を使う際の向きモード、ソース長、料金階層、参照画像の選択で、顔と体のドリフト問題を軽減できます。
