OpenGauntletが168のTTSおよび106のSTTシステムのカタログを公開
研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。
研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。
Hugging Face Hub上のすべての4,893のインド言語データセットを対象とした月次更新版のコンプライアンスマトリックスが公開され、2026年8月1日時点で65.1%がライセンスタグを宣言していないことが明らかになりました。
Calibra v0.7.1 は、品質およびカバレッジ分析の前に実行される新しいデータセット整合性(Dataset Integrity)ステージを導入し、ユーザーがロボティクスデータセットの信頼性を確認できるよう支援します。
Calibraは、研究者がポリシーをトレーニングする前にロボットデータセットを検証し、品質の問題を特定するのに役立つように設計されたオープンソースのツールキットです。最初の公開リリースには、LeRobotデータセットを検証するためのインタラクティブなSpace「Robot Dataset Health Check」と、ヘルススコア付きの30の公開LeRobotデータセットのベンチマークが含まれています。
Huggy Engineは、Hugging Face上でHuggy Databaseを公開しました。これは利用可能なフランス競馬のオープンデータセットの中で最大規模であるとされています。このリリースでは、機械学習アプリケーションでの使用を目的として、1996年から2026年までの30年間にわたる完全な日次カバレッジが提供されます。
Hugging Faceは、これまでに最も大きなオープンコードデータセットであるThe Stack v3をリリースしました。本リリースでは、異なるユーザーのニーズに対応するため、2つの異なるアクセス方法が提供されます。
louidevはHugging Face上でGlassBallAIデータセットを公開しました。これは、結果が判明する前にGoogleのGeminiモデルが行うリアルタイムの予測行動を捉えたものです。このデータセットには、2026年2月17日から5月19日にかけて収集された3,655件以上のレコードが含まれており、Gemini 2.5 Flash、2.5 Pro、2.5 Flash Lite、および3.0 Flash Previewをカバーしています。
IBMは、コードと実行トレースをペアリングすることでAIモデルのパフォーマンスを向上させるパイプラインおよび合成データセットであるCodeAlchemyをオープンソース化した。今回のリリースでは、15のプログラミング言語にわたる約1兆トークンが含まれており、その規模はWikipediaの少なくとも200倍に相当する。
あるユーザーが、流体流動や構造的場などの物理シミュレーションからトレーニング用データセットを生成する際の計算コストについての経験を共有しています。彼らは、主要な課題はモデルアーキテクチャではなく、各サンプルの生成コストが高い場合に大規模で多様なデータセットを構築することの難しさを強調しています。
研究者らは、再生可能エネルギーの予測パイプラインにおける自動かつ効率的な特徴量選択のための、新規なクラスタリングベースのラッパー手法であるCluster-based Sequential Feature Selection (CSFS)を提案する。このアプローチは、利用可能な監視および環境変数が多数ある中から入力特徴量を選択するための体系的な方法の欠如に対処する。
研究者らは、風力および太陽光発電の予測における体系的な特徴量選択の欠如に対処するために設計された、新規でモデル非依存のラッパー手法であるクラスターベース逐次特徴量選択(CSFS)を提案する。このアプローチは、再生可能エネルギーパイプラインに対して自動的、効率的、かつ信頼性の高い特徴量選択を提供することを目指している。
研究者らは、ベトナム語のホテル推薦のための6,832人のユーザーと560件のホテル間の18,267件の相互作用からなる公開データセットViHoRecを発表しました。このリソースは、HMAC擬似名を用いたクロスプラットフォームエンティティ解決とプライバシー保護されたリリースにおける課題に対処しています。
研究者らは、人間の注釈を不要にする多モーダル解析幾何学問題の完全自動生成のためのスケーラブルなフレームワークであるFormalAnalyticGeoを発表しました。このシステムは、符号付き距離場エンジンを通じて問題文と正確な図のレンダリングをつなぐために、CDLと呼ばれる形式的な中間表現を利用しています。
研究者らは、DNA折り紙を用いて秘密メッセージをナノモールス符号に変換する生体分子暗号化の方法を開発した。このアプローチは、従来のコンピュータベースの暗号化アルゴリズムではなく、生物学的分子を使用して情報を保護することを目指している。
あるユーザーが、1つの次元を削除し、存在論的クラスターラベルを10の絵文字カテゴリに置き換えることで、「感情の直交モデル」に基づく派生データセットを作成しました。
タクシーやライドシェアリングプラットフォームなどの共有モビリティサービス内で手話を使用する課題に対処するため、In-Car Sign Language (ICSL) コーパスと呼ばれる新しいマルチモーダルデータセットが導入されました。このリソースは、閉鎖された車内空間における難聴者およびろう者のコミュニティの公共交通アクセス向上を目指し、ブラジル手話 (Libras) に焦点を当てています。
研究者は、Compositionality Trend Predictionタスクを導入し、年代ごとの共時的評価からなる新規データセットに対して評価することで、23のドイツ語および26の英語の名詞複合語における意味変化を調査した。複合語が構成性を失う方向に決定的な傾向を示すとする既存の研究とは対照的に、本研究では時間の経過に伴うわずかな負の傾向のみが検出された。
研究者らは、労働力計画や労働市場分析のために設計された公開済みのJobHopデータセットを改善したJobHop v2をリリースしました。オランダ語圏フラーム地方の公共雇用サービスであるVDABから提供された約44万枚の擬似匿名化された多言語履歴書からエンドツーエンドの大規模言語モデル抽出によって構築され、このデータセットには355,315件のキャリア軌跡が含まれています。
オックスフォード大学の「Their Finest Hour Online Archive」を使用したプロジェクトは、大規模なキーワード抽出を自動化するために、固有表現認識、キーワード抽出、トピックモデリングという3つの自然言語処理アプローチを評価しました。この研究では、従来の統計モデルから最新の生成AIニューラルネットワークに至るまで、さまざまな手法にわたってこれらの方法をテストしました。
研究者らは、慣性センサーに基づく分類タスクにおける最小サンプルサイズの決定に関するデータ駆動型のガイドラインの欠如に対処するため、学習曲線の収束率の体系的な実証評価を発表した。