Mid-Harnessはテスト時の計算量スケーリングによりターミナルエージェントのアクション信頼性を向上させる
研究者らは、モデルとハーネスの境界で候補アクションをサンプリングして検証し、ターミナルエージェントの実行信頼性を向上させる手法であるMid-Harnessを発表した。このアプローチは、実行のために1つのアクションを送信する前に複数のオプションを検証することでテスト時の計算量を割り当て、ジェネレーターとハーネスの変更は行わない。
研究者らは、モデルとハーネスの境界で候補アクションをサンプリングして検証し、ターミナルエージェントの実行信頼性を向上させる手法であるMid-Harnessを発表した。このアプローチは、実行のために1つのアクションを送信する前に複数のオプションを検証することでテスト時の計算量を割り当て、ジェネレーターとハーネスの変更は行わない。
本記事では、制約 aware な構成計画を活用したヒューマンからロボットへの転移手法である Human2Any を紹介する。ソースにはそれ以上の詳細や本文は記載されていない。
研究者らは、複数の信頼できないアクセラレータが共有仮想アドレス空間内で事前に翻訳されたアドレスを安全に再利用できるようにするIOMMU設計であるShareMMUを発表しました。このアプローチは、大きな共有翻訳傍受バッファ(TLB)に関連するサイドチャネルリスクを軽減しつつ、高いパフォーマンスを維持します。
研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。
Nvidiaの研究者N. Horrocksは、安定化回路と確率的パウリエラーを扱う耐障害性量子プログラム用に設計された拡張検出器エラーモデル(EDEMs)を紹介します。これらのモデルにより、エラー解析がシーケンシャルおよび並列に合成可能となり、物理的な回路実装の構造を反映します。
研究者らは、state-of-the-artなORAM-ANNシステムの設計を反転させることで帯域幅とアクセス数をバランスさせ、disk-oblivious近似最近傍(ANN)検索のコスト効率の高いアプローチであるOnyxを提案した。
研究者らは、アバターの再構築をヘッドセットから信頼できないローカルデバイスにオフロードしつつ、データ傍受から保護するフレームワーク「Privatar」を発表した。このシステムは、アバターの再構築に関するドメイン固有の知識を活用し、最小限のパフォーマンスコストで証明可能なプライバシー保護型オフロードを実現している。
NVIDIAの研究チームは、格子ベースプロトコルに固有の高いサーバー側計算とメモリトラフィックに対処することで、GPU上でのプライベート情報取得(PIR)を加速するシステムGPIRを発表しました。このシステムは、チップ内データ再利用を最大化するために、演算レベルとステージレベルのカーネルの間で動的に切り替えるステージ対応型ハイブリッド実行モデルを採用しています。
新しい研究は、プライバシー保護機械学習推論のための安全なマルチパーティ計算(MPC)および完全ホモモフィック暗号(FHE)の統一されたシステムレベルでの特性評価を示しています。この作業は、複数のCNNおよびTransformerモデルにおいて、2つのMPCバリアント—算術/バイナリ共有変換および関数秘密共有—とFHEを評価します。
NVIDIAの研究員によるポジションペーパーは、信頼できないデータに埋め込まれた悪意のある指示が危険なアクションを引き起こす間接プロンプトインジェクション攻撃からAIエージェントを守るためのビジョンを概説しています。著者たちは、効果的な防御には孤立したモデルの修正を超え、包括的なシステムレベルのアーキテクチャへの移行が必要であると主張しています。
研究者らは、大型推論モデル(LRM)における明示的な多段階推論の高い計算コストを悪用する、推論時のサービス拒否(PI-DoS)攻撃を形式化しました。彼らは、被害者モデルを病的に長く、しばしば終了しない推論トレースへと駆り立てる短い自然言語プロンプトを生成する攻撃者を訓練する、強化学習ベースのフレームワークであるReasoningBombを発表します。
研究者らは、間接的なプロンプトインジェクション攻撃に対して大規模言語モデル(LLM)の安全なアライメントを改善するために設計されたモデルレベルのソリューションであるReasAlignを導入した。このアプローチは、ユーザーのクエリを分析し矛盾する指示を検出するために構造化された推論ステップを組み込み、ユーザーの意図したタスクの継続性を確保する。