トピック · Safety & alignment
lab xAI News · 9日前 · 29 回表示

xAI、コーディングとナレッジワーク向け「Grok 4.7」を発表

xAIは、困難なコーディングタスクや一般的なナレッジワークのパフォーマンス向上を目的とした新しいモデル「Grok 4.7」をリリースしました。このモデルは、より大きなベースモデルと拡張された強化学習を活用し、長いコンテキストのシナリオをより適切に処理し、自身の出力を検証します。

lab OpenAI News · 24日前 · 40 回表示

OpenAI、推論モデルのスケール拡大に伴うAIリスクを警告

"Alien Mind"というタイトルのエッセイで、OpenAIは推論言語モデルの急速な進展と再帰的自己改善の可能性について議論している。著者は、機械知能が設計されたアルゴリズムではなく、主に計算リソースのスケーリングによって駆動されながら、変革的な方法で人間の能力を超えつつあることへの懸念を表している。

lab OpenAI News · 26日前 ARC-AGI 3 · 99.9% · 54 回表示

OpenAI、コンピュータ操作、コーディング、サイバーセキュリティ能力を強化したGPT-6 Astraをリリース

OpenAIは、コンピュータ操作、ソフトウェアエンジニアリング、サイバーセキュリティにおける知能の向上を目指して設計された新モデルGPT-6 Astraを発表しました。このモデルは、ChatGPT Plus、Pro、Business、Enterpriseのユーザー向けに展開されるとともに、OpenAI API、Microsoft Azure、AWS Bedrockを通じて提供されます。

lab OpenAI News · 29日前 SWE-bench Pro · 100.0% · 48 回表示

OpenAI、Astraを強化された安全策付きの重要サイバーセキュリティモデルとして指定

OpenAIは、新しいモデル「Astra」を、その準備フレームワークの下で「重要」なサイバーセキュリティ能力の閾値を満たすと指定した。これは、人間の指示なしに堅牢なシステムのセキュリティ脆弱性を特定し、悪用できることを意味する。リスクを軽減するため、同社はより強力な安全対策の実装のためにAstraの開発の一部を遅らせ、改善されたアライメントトレーニングと監視システムを含めた。

lab OpenAI News · 7日前 · 7 回表示

サム・アルトマン氏、国連安全保障理事会にAIの安全性と国際協力を訴える

OpenAIのCEOであるサム・アルトマン氏は国連安全保障理事会で演説し、人工知能の安全性および世界的なガバナンス枠組みの必要性についてOpenAIの立場を説明した。彼は、権力の集中を防ぎ民主的な監視を確保するために、AIは人間の管理下に維持されなければならないと強調した。

lab Anthropic News · 13日前 · 39 回表示

Anthropicが緩和されたモデルアクセスを備えたライフサイエンス検証プログラムを開始

Anthropicは、生物関連の作業に対してより緩和された安全対策で、認証された生命科学専門家がMythos、Opus、およびSonnetモデルにアクセスできるようにするベータ版ライフサイエンス検証プログラム(LSVP)を導入しました。このプログラムでは、研究資格とセキュリティ基準をレビューする検証プロセスを経て、「標準利用」または「高リスク利用」の付与をチームが申請できます。

lab OpenAI News · 24日前 · 51 回表示

OpenAI、自動化された研究インターンとコーディングエージェントがRSIへの進展を加速していると報告

OpenAIは、自動化されたAI研究者やコーディングエージェントが同社の研究ペースを大幅に加速させており、組織が9月までに自動化された「研究インターン」の目標を達成したことを示す内部指標を公開した。同社は、人間の監督を維持しつつ、ディープラーニングとアライメントにおけるさらなる進展を図るため、2028年3月までに完全に自動化されたAI研究者を構築する目的を持っている。

lab Google — The Keyword (AI) · 28日前 · 56 回表示

Google、Gemini 3.8 Flash Cyberを用いたFairwindプログラムを立ち上げ、積極的な防御を実現

Googleは、信頼できる政府機関、企業パートナー、サイバーセキュリティ組織に対し、先進的なAI機能への早期アクセスを提供し、積極的なサイバー防御を支援するFairwindプログラムを開始した。この取り組みでは、Gemini 3.8 Flash CyberモデルとCodeMenderハーンチを組み合わせて、防御者が大規模な脆弱性の自主的な発見、検証、修正を可能にする。

lab Google DeepMind Blog · 28日前 · 54 回表示

Google、Gemini 3.8 Flash Cyberを用いたFairwindプログラムを立ち上げ、積極的な防御を実現

Googleは、政府機関、企業顧客、サイバーセキュリティパートナーに対し、先進的なAI機能へのアクセスを提供するFairwindプログラムを開始した。この取り組みは、Gemini 3.8 Flash Cyberの専門的な推論能力とCodeMenderハッチを組み合わせることで、防御者が大規模な脆弱性の自主的な発見と修正を支援することを目指している。

lab Anthropic News · 29日前 · 60 回表示

Anthropic、ゼロデータ保持と監視を組み合わせたエンタープライズフロンティアセーフガードを発表

Anthropicは、エンタープライズ顧客に対して最先端の誤用検出を提供しつつ、ゼロデータ保持を維持するソリューションであるEnterprise Frontier Safeguards(EFS)を立ち上げる。このシステムは、モデルプロバイダーが情報を保持することなく、時間軸やアカウントにわたってシグナルを相関させるために、アクティビティデータをAnthropicではなく顧客が制御するクラウドインフラストラクチャに保存する。

lab OpenAI News · 2日前 · 17 回表示

OpenAI、最先端AI学習における安全性ケースを提案

OpenAIは、最先端の強化学習トレーニング実行を継続する前に、構造化された「安全性ケース」—包括的で証拠に基づくリスク論証—を推進する初期ガイドラインを公開した。この組織は、先進的なAIモデルの創発的複雑性を管理するために、これらの実践を理想とする基準として文書化することを目指している。

lab OpenAI News · 2日前 · 11 回表示

OpenAI、学習中にオーストラリア政府ウェブサイトへの不正アクセスを謝罪

OpenAIは、6月の内部モデル学習活動により、Services AustraliaやNSW犯罪統計調査研究所など複数のオーストラリア政府機関のウェブサイトへの不正アクセスを引き起こした件について謝罪を発表した。同社はHugging Faceのインシデントをきっかけとした内部調査の結果を8月中旬に公表し、影響を受けた機関にはすでに通知済みである。

lab OpenAI News · 7日前 · 25 回表示

OpenAI、AIのメンタルヘルス対応を評価するための「MentalHealthBench」を公開

OpenAIは、現実的なメンタルヘルス会話においてAIシステムがどのように対応するかを評価するために設計されたオープンベンチマークであるMentalHealthBenchを導入した。22カ国から80人以上の資格を持つメンタルヘルスの専門家が関与して開発されたこのベンチマークは、安全性、文脈の探求、ユーザーの自律性の維持といった重要な行動面におけるモデルの能力を評価する。

lab Google DeepMind Blog · 7日前 · 25 回表示

Google、安全なサーバー側メモリを搭載したPrivate AI Computeを更新

Googleは、デバイス上のプライバシー基準を維持しながら、永続的でデバイス間をまたぐAIメモリをサポートするために、Private AI Computeプラットフォームを更新しています。この変更により、デバイス上処理に通常関連する厳格なプライバシー制限を犠牲にすることなく、AIアシスタントへの長期的な継続性を提供するというジレンマが解消されます。