OpenAIの主力モデルGPT-5.6は、同社の安全枠組みで「サイバーセキュリティ=High」「生物・化学=High」と格付けされています。その状態で、7月9日から誰でも使えます。9月1日には、一つ上の「Critical」に達したと指定されたAstraが、2日後に一般提供されました。格付けをしているのは誰か、3社の枠組み文書を読みました。
① 事実
OpenAI、Anthropic、Google DeepMindの3社は、自社のAIの危険度を格付けする枠組みを、それぞれ文書で公表しています。GPT-5.6の「High」もAstraの「Critical」も、その枠組みの中の等級です。文書には、誰が評価し、誰が判断し、誰が最終決定し、誰が覆せるかが書いてあります。3社とも判断は社内で閉じ、政府の承認は要件にありません。会社ごとに、書いてあることと書いていないことが違います。
OpenAIは、GPT-5.6の3モデルを「サイバー=High」「生物・化学=High」と格付けし、7月9日から誰でも使える形で提供しています
OpenAIが7月9日に公開したGPT-5.6のシステムカード(モデルの安全性評価をまとめた文書)は、Sol・Terra・Lunaの3モデルについて、同社のPreparedness Framework(最先端のAIの危険度を事前に格付けし、対応する安全策を決める社内の枠組み)での格付けを載せています。サイバーセキュリティがHigh、生物・化学がHigh、AIの自己改良はHighに満たない、という格付けで、3モデルとも同じです。
Highは、同枠組みの定義で「既存の深刻な危害への経路を大きく増幅しうる能力」です。この水準に達したモデルは、危害の危険を十分に下げる安全策を付けてからでなければ出せない、と枠組みは定めています。
Solは6月26日に、米政府が個別に承認した約20社への限定公開で始まり、7月9日に全面公開されました(Vol.08)。いまはAPI(他社のソフトウェアからAIを呼び出す口)で誰でも使え、料金は100万トークンあたり入力4ドル・出力20ドルです(8月21日から11月21日までの値下げ期間=Vol.39)。
システムカードは、安全策も書いています。SolとTerraには「機微な領域に絞った活性化分類器(モデルが答えを作っている最中を監視し、危険な出力を途中で止める仕組み)」を新たに付けたこと。「以前のモデルと比べて、GPT-5.6 Solのサイバー安全策はおよそ10倍多くの潜在的に有害な活動を止める」こと。10倍の比較対象のモデル名は、書かれていません。
9月1日に「Critical」と指定されたAstraは、9月3日にMicrosoft Foundryで、9月5日にOpenAIのAPIで使えるようになりました
OpenAIは9月1日、Astraを「サイバーセキュリティの能力がCriticalの水準に達した最初のモデル」と自ら指定しました(Vol.44)。Criticalは、Highの一つ上で「前例のない新しい危害の経路を生みうる能力」です。
そのAstraは、9月3日にMicrosoft Foundry(Microsoftのクラウド上でAIモデルを提供する基盤)で全顧客向けに一般提供され(Vol.56)、9月5日にOpenAIのAPIに出ました。本紙はその日にCoBANTO3-AIに追加しています(Vol.46)。指定から一般提供まで、2日です。
格付けを決める手順は、OpenAIの枠組み文書の付録Bに書いてあります
2025年4月15日版のPreparedness Frameworkの付録B「意思決定の実務」に、役割が並んでいます。
- 評価=社内のチームが試験を回し、「能力報告書」を作ります。外部の評価者(英国政府のAI Security Institute、METR、Apollo Researchなど。後の2つはAIの評価を専門にする非営利団体)が試験を請け負いますが、位置づけは「SAGに出す証拠の一部」です。
- 判断=Safety Advisory Group(SAG)。原文は「社内の、部門横断の、OpenAIの幹部の集まり」です。能力報告書を読み、しきい値を越えたか安全策で足りるかを判断し、経営陣に勧告します。委員も議長も経営陣が任命し、任期は1年です。
- 最終決定=「OpenAI Leadership、すなわちCEOまたはCEOが指名した人」。原文=「残る危険を受け入れることと、出す・出さないの判断を含む、すべての最終決定」。同じ付録に「疑義を避けるために言えば、経営陣はSAGの参加なしでも決定できる。つまりSAGには議事妨害の権限がない」とあります。
- 覆せる人=取締役会の安全・セキュリティ委員会。「必要な場合、取締役会は決定を覆し、修正した方針を命じることができる」。
政府や規制当局の承認は、要件として書かれていません。「米国政府とその協力者」は、脅威モデルを作るときに参照する相手として名前が出るだけです。
GPT-5.6のシステムカードの側は、格付けを「徹底した能力試験の結果、我々は判断した」と書いています。誰が判断したかは、システムカードには書かれていません。
Anthropicは、CEOと責任者の2人が承認し、取締役会と信託には決定後に報告します
AnthropicのResponsible Scaling Policy(RSP=同社がAIの能力に応じて安全策を上げていく方針文書)は、現行が2026年7月8日のv3.4です。3.4節「手順」に4段階があります。
- 社内の専門家が危険を評価し、リスク報告書を書く
- 社内から意見を集める。「通常は、関連する専門知識を持つ信頼できる外部の当事者からも意見を求める」
- CEOとResponsible Scaling Officer(RSO=この方針の実施責任者)が最終審査と承認をする。「CEOとRSOが、危険評価の妥当性と、その後の展開・開発計画についての最終的な判断を下す」
- 承認のあと、CEOとRSOは決定と報告書を、取締役会とLong-Term Benefit Trust(LTBT=同社の取締役の一部を選任する権限を持つ信託)に「速やかに共有する」
例外が一つあります。「他社のAIも同じ危険を持つので、自社の分の上乗せは小さい」という理屈が判断の主な根拠になる場合は、CEOとRSOだけでなく、取締役会とLTBTの明示の承認が要ります。
外部の目については、v3.2(4月29日)でLTBTが外部レビューを要求できるようになり、レビュアーの選定はLTBTの承認が要ることになりました。同社が8月に出したリスク報告書には「この変更以来、LTBTは外部レビューを要求していない(RSPが要求したこともない)。ただし試験的な外部レビューは続けている」とあります。試験的なレビューは、METRがAI研究開発の節を、SecureBio(生物安全を専門にする非営利団体)が生物・化学の節を読み、それぞれ公開の報告書を出しています。
このRSPは、2026年2月24日のv3.0で全面改訂されました。改訂の理由は序文にあります。「一つのAI開発者が安全策を入れるために開発を止め、他社が強い緩和策なしに進めば、世界はかえって安全でなくなりうる。最も弱い保護の開発者が速度を決めることになる」。そのうえで「業界全体への提言」と「自社としての計画」を分け、提言については「一方的に従うことは約束できない」と書いています。
Googleの文書は、「適切なガバナンス機能」が決めると書き、委員会の名前も最終決定者も書いていません
Google DeepMindのFrontier Safety Framework(2026年4月17日のv3.1)は、危険度の物差しをCCL(Critical Capability Level=深刻な危害の危険が大きく増す能力水準)と、その手前のTCL(Tracked Capability Level)で定めています。
判断の主体は、本文の各所で「適切なガバナンス機能が残る危険を許容できると判断したあとでなければ、外部への展開は行わない」と書かれています。第4節「ガバナンスと説明責任」は6行です。「評価と緩和の責任は組織のすべての階層に明確に定義され配分されている。法務、コンプライアンス、安全のレビューと、適切な監督を確保するためのエスカレーション手順を含む」。委員会の名前も、最終決定者も、覆せる人も、書かれていません。
政府については5.2節に、モデルがCCLに達し「緩和されていない重大な危険」がある場合、「適切な政府当局と関連情報を共有することを目指す」とあります。承認ではなく、共有です。
外にある目は、3つです
3社の文書の外に、格付けに関わる制度が3つあります。
- 米国の大統領令(2026年6月2日)。最先端のモデルを広く公開する前に、最大30日、政府が先に触れられるようにするものです。命令文は「任意」と明記し、許認可でも事前承認でもないと断っています(Vol.08)。
- カリフォルニア州のSB 53(2025年9月29日成立)。年間売上5億ドル超の開発者に、自社の安全枠組みの公表と年1回の更新、新モデル公開時の透明性報告、重大事故の15日以内の州への報告を義務づけます。違反1件あたり最大100万ドルの民事罰を州司法長官が科します。州が枠組みの中身を評価したり、格付けを承認したりする条文はありません。
- EUのAI法 第92条(2026年8月2日から適用)。欧州委員会のAI事務局が、汎用AIモデルの評価を自ら実施できます。APIや、必要ならソースコード(プログラムの設計そのもの)へのアクセスを求められ、独立の専門家に評価を委ねることもできます。対象は法の義務への適合と、システミックリスク(社会全体に及ぶ危険)の調査です。
3つのうち、モデルそのものを評価する権限を持つのはEUだけで、それも7週間前に始まったばかりです。High・Critical・ASL・CCLという物差しは、いずれも各社が自分で定義したもので、外の制度が定めた等級ではありません。
出典:
- OpenAI「GPT-5.6 System Card」(2026年7月9日・8月19日更新) https://deploymentsafety.openai.com/gpt-5-6
- OpenAI「Preparedness Framework Version 2」(2025年4月15日/付録B) https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf
- OpenAI「Path to Astra: critical capabilities and frontier safeguards」(2026年9月1日) https://openai.com/index/path-to-astra
- Anthropic「Responsible Scaling Policy Version 3.4」(2026年7月8日) https://www.anthropic.com/responsible-scaling-policy
- Anthropic「Risk Report: August 2026」(1.3.5節) https://www.anthropic.com/aug-2026-risk-report
- Google DeepMind「Frontier Safety Framework Version 3.1」(2026年4月17日) https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/strengthening-our-frontier-safety-framework/frontier-safety-framework_3-1.pdf
- California SB 53(Transparency in Frontier Artificial Intelligence Act) https://leginfo.legislature.ca.gov/faces/billTextClient.xhtml?bill_id=202520260SB53
- EU AI Act Article 92(Power to Conduct Evaluations) https://artificialintelligenceact.eu/article/92/
- OpenAI「Better Language Models and Their Implications」(2019年2月14日) https://openai.com/index/better-language-models/
- OpenAI「GPT-2: 1.5B Release」(2019年11月5日) https://openai.com/index/gpt-2-1-5b-release/
② 構造
AIの危険度の格付けは、いまのところ、売っている会社自身が自分の物差しで自分の製品に付けています。いわゆる自主規制、自主基準です。評価、格付け、安全策、出荷の判断は同じ会社の中の階層を上がり、CEOで止まります。その外にある政府の制度がしているのは、先に見ることと、公表させることと、事故を報告させることまでです。格付けを上げても、売るのをやめた例はありません。この形は、OpenAI自身が7年前に通った形と、他の産業が過去に通ってきた形に重なります。
評価から出荷までの判断が、同じ会社の中で閉じています
判断は、三段に積まれています。
一番下が、能力の評価です。試験を作り、走らせ、数字を出します。技術の層の仕事です。
その上が、格付けです。出た数字を、自社で決めたしきい値に当てて、HighかCriticalかを決めます。
一番上が、出荷の判断です。安全策を付けて出すか、配る相手を絞るかを決めます。事業の判断です。
3社の文書では、この三段が全部、同じ会社の中にあります。OpenAIでは技術チーム、SAG、CEOの順です。Anthropicでは専門家、CEOとRSOの順です。Googleは、段の名前を書いていません。
外の制度が触れているのは、この階層の外側です。米国の大統領令は出す前に30日触らせ、カリフォルニア州は枠組みを公表させて事故を報告させ、EUは8月から自分で評価できます。いずれも、格付けの物差しを定める権限も、格付けを承認する権限も持っていません。物差しを持っているのは、売る側だけです。
順序も、業界が先です。カリフォルニア州の法律が義務づけたのは「自社の安全枠組みの公表」で、3社は法律より前に枠組みを公表していました。業界が先に作った物差しが、外の制度の前提になっています。業界の側が、外の環境を作っている形だと読めます。
格付けをしている側が、「一社では約束できない」と書きました
Anthropicの2月の改訂は、自主格付けの限界を、格付けをしている側が文書にしたものだと読めます。以前のRSPは、他社がどうであれ自社の危険を許容水準まで下げると約束していました。改訂後は、業界全体への提言と自社の計画を分け、提言は「一方的には約束できない」としました。理由は「最も弱い保護の開発者が速度を決める」からです。
一社ずつが自分の物差しで格付けする形では、いちばん緩い物差しに全体が引かれます。その構造を、当事者が自分の方針文書に書きました。書いたうえで、同社は自社の判断の手順(CEOとRSOの承認)を変えていません。変えたのは、約束の範囲です。
同じRSPの付録Aは「競合他社に関する約束」です。競合が強い安全策を持っていれば「それと同等以上の水準にする」、自社だけが先行していれば「危険が封じ込められていると強く論証できるまで、開発と展開を遅らせる」とあります。他社の安全策の水準を、自社の約束の基準に置いた条項です。3社が同じ週に同じ形の発表をしたこと(Vol.44)と合わせると、明文の申し合わせは無いまま、互いの公表物を読み合って歩調を取る形になっている、と読めます。
格付けが上がって、売るのをやめた例は、3社の公表物にありません
HighもCriticalも、枠組みの設計では「出さない」の等級ではなく、「安全策を付けて出す」の等級です。Preparedness Frameworkの原文は、Highを越えたモデルには「展開の前に、深刻な危害の危険を十分に下げる、堅牢で効果的な安全策」が要る、Criticalには開発中にも要る、と定めています。出荷を止める規定は、どちらにもありません。
実績を並べます。Solは限定公開の13日後に全面公開されました。AstraはCritical指定の2日後に一般提供されました。AnthropicのClaude Mythos 5.1は、安全装置を緩めた版だけを、審査を通った相手に絞りました(Vol.42)。格付けが配り方を狭めた例はあります。売るのをやめた例は、3社の公表物にありません。
格付けは、発表文の中で能力の説明と隣り合って置かれています。Astraの発表文は、Criticalの指定と、ExploitBenchで満点という数字を同じ文書に載せました(Vol.44)。GPT-5.6のシステムカードは、Highの格付けと「10倍多く止める」を並べています。危険度が高いという格付けと、能力が高いという説明が、同じ文書の中にあります。
格付けを上げて会社が失うものは、公表物からは見えません。能力の高さは、格付けを通しても伝わります。この配置で、高い格付けが宣伝として働いているかどうかは、公表物からは分かりません。分かるのは、上げても売れなくならない設計だ、というところまでです。
OpenAIは、同じ形を7年前に一度通っています
2019年2月14日、OpenAIはGPT-2を発表し、悪用の懸念を理由に完全版を公開しませんでした。公開したのは小さい版で、8月に中間の版、11月5日に完全版を出しています。当時、この判断を宣伝だと批判した研究者がいました(カリフォルニア工科大学のAnima Anandkumar教授)。11月の全公開時に、OpenAIは「これまでのところ、悪用の強い証拠は見られない」と書いています。
当時と違うのは、いまは枠組み文書と等級があることです。同じなのは、危険だと言う側と、売る側が同じ会社であることです。
自己申告で回る制度に外の目が入ったのは、事故か不正の発覚のあとでした
日本の自動車の型式指定は、メーカーが自社で試験を行い、国はその結果を審査する制度です。2024年6月、国土交通省は85社への調査の結果として、トヨタ、マツダ、ヤマハ発動機、ホンダ、スズキの5社で、型式指定の申請に不正があったと公表しました。対象は38車種です。国が確認試験と立入検査を増やしたのは、そのあとです。
決算書も同じ形です。会社が自分で作り、外部の監査が付くのは一定の規模から。読者は、監査の付かない決算書を銀行が読んでいる側にいます。
自己申告で回っている制度に、外の検査が入るのは、事故か不正が見つかったあと。過去の産業は、その順序で来ました。AIの格付けは、まだ事故の前の段階にあると読めます。EUの第92条が8月に動き出したのは、その順序の最初の例外になるかもしれません。まだ7週間で、実施例は公表されていません。