Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
画像API のコンテンツフィルタ:拒否が起きるメカニズム
2026/08/01

画像API のコンテンツフィルタ:拒否が起きるメカニズム

画像API のフィルタリングは複数層で動作します。同じプロンプトが一方のホストを通過して別のホストで失敗することもありますが、設定に関わらず変わらない境界線もあります。

画像のコンテンツフィルタリングは多層的で、単なるオン/オフスイッチではありません。ホストされた画像API の一部は、リクエストごとに調整可能なモデレーション設定を公開していますが、1つの層を調整しても、プロバイダーのポリシー、モデルのアライメント、上流のリクエスト検査、法的制限、またはアプリケーションレベルの義務は消えません。異なるホストはリクエストをさまざまにルーティングし、各ルートは複数のチェックポイントを通過します。

より有用な質問は、どの安全層がリクエストをブロックしたのか、どのコントロールが実際に設定可能なのかということです。このフレーミングは、医学的な図解、美術作品、水着、健康教育など、良性の偽陽性に対処するのに役立ちます。禁止されたコンテンツが許容可能になったと主張する必要はありません。

TL;DR

  • 本番環境の画像API は、無条件でフィルタリングされていないものとして扱うべきではありません。
  • 一部のホストは、設定可能なモデレーション設定を公開しており、選択したルートで調整できます。これは上流のプロバイダーモデレーションを無効にしません。
  • 異なるベンダーは、フィルタリングコントロールをダイレクトコーラーに公開するかどうかが異なります。出力チェックの調整を許可するものもあれば、そうでないものもあります。
  • 段階的に拒否を診断します。タスク作成前、プロバイダー生成中、または出力が返された後。
  • 「制限の少ない」ものでも、同意、年齢管理、虐待防止、およびプロバイダーの利用可能規則への準拠が必要です。

「検閲されていない AI 画像API」が誤ったテクニカルモデルである理由

画像の安全性はパイプラインであり、1つのブール値ではありません。リクエストは1つの分類器を通過し、次の段階で失敗する可能性があります。モデルが比較的軽いアライメントを持つ場合でも、ホスト、ゲートウェイ、ストレージプロバイダー、またはアプリケーションが別の管理を適用する場合があります。

典型的な本番環境のリクエストは4つの層を通ります。

  1. アプリケーションポリシー。 独自の製品は、ユーザー、プロンプト、ソース画像、権限、および意図された用途を検証します。
  2. ゲートウェイモデレーション。 API ゲートウェイは、独立したプロンプトまたは出力分類器を実行する場合があります。
  3. プロバイダーとモデルのコントロール。 上流のサービスは、その独自のポリシーに基づいて入力を拒否、生成を拒否、または結果をフィルタリングできます。
  4. 出力レビューと配信。 アプリケーションは、生成されたアセットを保存、表示、共有、または公開できるかどうかを決定します。

例えば、OpenAI は、テキストと画像の入力を分類するための別のモデレーションモデルについて記載していますが、そのプラットフォームデータコントロールは、変更されたユーザー監視または0データ保持の承認を受けた場合でも、お客様が使用ポリシーに従うことを要求します。[1][2]リテンション設定、モデレーション動作、および生成ポリシーは関連していますが、相互に交換可能ではありません。

4層のAI画像APIモデレーションパイプラインは、アプリケーションポリシー、ゲートウェイチェッカー、プロバイダーコントロール、出力レビューを示しています

画像API の安全拒否を診断する方法

タスク ID が存在する前に拒否された

リクエストはおそらくアプリケーション検証、ゲートウェイプロンプトモデレーション、認証、または上流の入力検査で失敗しました。HTTP ステータス、プロバイダーエラーコード、モデル ID、および有効なカスタマイズ可能なチェックをキャプチャします。

プロンプトを自動的に変更して再送信しないでください。まず、リクエストが不正な形式であるか、良性だが曖昧であるか、またはポリシー外であるかを判断してください。

タスクは作成されたが生成に失敗した

プロバイダーまたはモデルは、より深い検査後にプロンプトまたはソース画像を拒否した可能性があります。一部のシステムは、参照画像がダウンロードできない、形式が間違っている、またはサイズ制限に違反している場合にも失敗します。テレメトリで安全エラーとテクニカルメディアエラーを分けておきます。

生成は完了しているが、出力は非表示です

このパターンは出力分類層を示しています。ホストが生成ステップを最終的な安全チェックから分離する場合、出力は生成および請求されることがありますが、最終画像は控えられます。したがって、再試行は根本的な問題を変更せずに料金を繰り返す可能性があります。

出力が返されているがアプリケーションがブロックする

これはアプリケーション設計通りに機能しているアプリケーションポリシーです。モデル出力は、公開と権利チェックに合格するまで信頼できないユーザーコンテンツです。プロバイダーが画像を受け入れることは、マーケットプレイス、広告ネットワーク、学校、またはアプリストアが受け入れなければならないことを意味しません。

より制限の少ない画像API を責任を持って選択する方法

「検閲されていない」という言葉ではなく、管理とドキュメントを探します。

明示的なリクエストフィールドを優先します

モデレーションを制御するための記載されたフィールドは、漠然と「フィルタなし」を約束するプロバイダーより簡単に管理できます。テストでき、アカウント別に制限でき、構成を記録でき、スキーマの変更を検出できます。

明確な利用可能規則が必要です

プロバイダーは、禁止されたカテゴリ、アピール、データ処理、および施行を定義する必要があります。ルールが不足しているのは、運用リスク であり、創造の自由ではありません。

良性の境界線のセットをテストします

製品に関連する許可された医学、美術、ファッション、健康シナリオをカバーする小さな評価セットを構築します。承認、偽陽性段階、レイテンシー、および請求額を記録します。このテストセットに違法または搾取的な素材を含めないでください。

アイデンティティと同意のチェックを分離したままにします

一般的なポルノグラフィー分類器は、非同意の親密な画像、顔の誤用、なりすまし、著作権、またはモデルリリースの同意を解決しません。これらには独自のルールが必要で、場合によっては人的レビューが必要です。

プロバイダーの追跡可能性を保持します

モデル ID、プロバイダーのルート、ポリシーのバージョン、プロンプトハッシュ、ソースアセットの来歴、安全設定、および決定結果を保存します。保持される個人データを最小化しますが、虐待と控訴を調査するために十分な構造化された証拠を保持します。

購入者に注意を促す必要があるクレーム

次のマーケティングフレーズを警告信号として扱ってください。

  • 利用可能規則なしで「100%検閲されていない」
  • リテンション文書または契約条件なしで「ログなし」
  • 管轄権または年齢制限なしで「すべてのコンテンツが許可されている」
  • ゲートウェイ、プロバイダー、またはモデルに影響するかを説明することなく「フィルタ オフ」
  • ストレージおよび虐待監視を説明することなく「デフォルトでプライベート」

同じ注意が不正なアカウント自動化に適用されます。第三者ラッパーは、使用しているアカウントまたはエンドポイントを非表示にするため、寛容に見えるかもしれません。これは安定した API コントラクトではありません。JSON エンドポイントが機能しているようであっても、認可は重要です。

アプリケーションレベルのモデレーションポリシーを構築する

実用的な画像アプリケーションは、1つの普遍的なしきい値以上のものが必要です。

  1. 決して受け入れられないコンテンツを定義します。
  2. 特定のコンテキストまたは年齢グループでのみ許可されるコンテンツを定義します。
  3. ソース画像のアイデンティティ、同意、および権利のリスクを別々に検出します。
  4. プロンプトと出力をレビューします。どちらの側もポリシーリスクを持つ可能性があります。
  5. 許可されたエッジケースについて、ユーザーに理由コードとアピールパスを与えます。
  6. 繰り返されたリクエストを拒否し、敵対的なパターンを調査する速度制限。
  7. モデル、プロバイダー、または分類器のバージョンが変更されるたびに再テストします。

OpenAI のモデレーションエンドポイントは、テキストと画像の入力の両方を分類できますが、そのカテゴリーとしきい値は1つの可能なポリシーコンポーネントにすぎません。[1]最終的なルールは、製品の対象者、地域、配信チャネル、およびリスク許容度と一致する必要があります。

ビデオでは、同じ層別フィルタリング原則が適用されます。画像モデルの設定がビデオ生成ルートに変更されていないと想定しないでください。

FAQ

コンテンツフィルタリングを完全に無効にできますか?

無条件の意味ではありません。ホストされた API は、1つのオプションのフィルタリング層を調整できる場合でも、プロバイダーポリシー、法律、インフラストラクチャコントロール、およびアプリケーションルールに基づいて動作します。

医学アプリケーションまたは美術アプリケーションは偽陽性にどのように対処すべきですか?

レビュー済みのプロンプト、成人のみおよび非性的コンテキスト(関連する場合)、ドメイン固有のモデレーションポリシー、理由コード、および人的アピールを使用します。すべての安全層を無効にすることに依存しないでください。

結論

制限の少ない画像 API を見つけることへの答えは、プロバイダーのリーダーボードではありません。これはモデレーションパイプラインを理解することです。明示的なコントロール付きのルートを選択し、各コントロールが影響を与える層をドキュメント化し、上流のポリシー仮定を見える状態に保ち、広いな偽陽性フィルタを、安全システムなしではなく、より正確な安全システムに置き換えます。

References

  1. OpenAI. Moderations API reference for text and image inputs. platform.openai.com/docs/api-reference/moderations
  2. OpenAI. Data controls, abuse monitoring, and customer responsibilities. platform.openai.com/docs/models/default-usage-policies-by-endpoint