Training data
media Hugging Face Forums · 6日前

OpenGauntletが168のTTSおよび106のSTTシステムのカタログを公開

研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。

media Hugging Face Forums · 12日前 · 2 回表示

Calibra: ロボットデータセットの観測性のためのオープンソースツールキット

Calibraは、研究者がポリシーをトレーニングする前にロボットデータセットを検証し、品質の問題を特定するのに役立つように設計されたオープンソースのツールキットです。最初の公開リリースには、LeRobotデータセットを検証するためのインタラクティブなSpace「Robot Dataset Health Check」と、ヘルススコア付きの30の公開LeRobotデータセットのベンチマークが含まれています。

media Hugging Face Forums · 12日前 · 3 回表示

Huggy Engineが最大のオープンなフランス競馬データセット「Huggy Database」をリリース

Huggy Engineは、Hugging Face上でHuggy Databaseを公開しました。これは利用可能なフランス競馬のオープンデータセットの中で最大規模であるとされています。このリリースでは、機械学習アプリケーションでの使用を目的として、1996年から2026年までの30年間にわたる完全な日次カバレッジが提供されます。

media Hugging Face Forums · 23日前 · 3 回表示

louidevがGeminiの予測を時限ロックしたデータセットGlassBallAIを公開し、LLMの行動研究に寄与

louidevはHugging Face上でGlassBallAIデータセットを公開しました。これは、結果が判明する前にGoogleのGeminiモデルが行うリアルタイムの予測行動を捉えたものです。このデータセットには、2026年2月17日から5月19日にかけて収集された3,655件以上のレコードが含まれており、Gemini 2.5 Flash、2.5 Pro、2.5 Flash Lite、および3.0 Flash Previewをカバーしています。

lab IBM Research (Granite) · 23日前 HumanEval · 83.5%

IBMがCodeAlchemyをオープンソース化:高品質なコードの大量合成データセット

IBMは、コードと実行トレースをペアリングすることでAIモデルのパフォーマンスを向上させるパイプラインおよび合成データセットであるCodeAlchemyをオープンソース化した。今回のリリースでは、15のプログラミング言語にわたる約1兆トークンが含まれており、その規模はWikipediaの少なくとも200倍に相当する。

media Hugging Face Forums · 24日前

科学MLシミュレーションにおけるデータボトルネックの処理に関する議論

あるユーザーが、流体流動や構造的場などの物理シミュレーションからトレーニング用データセットを生成する際の計算コストについての経験を共有しています。彼らは、主要な課題はモデルアーキテクチャではなく、各サンプルの生成コストが高い場合に大規模で多様なデータセットを構築することの難しさを強調しています。

arxiv arXiv cs.LG · 24日前

CSFSが風力・太陽光発電の予測における特徴量選択コストを21%削減

研究者らは、再生可能エネルギーの予測パイプラインにおける自動かつ効率的な特徴量選択のための、新規なクラスタリングベースのラッパー手法であるCluster-based Sequential Feature Selection (CSFS)を提案する。このアプローチは、利用可能な監視および環境変数が多数ある中から入力特徴量を選択するための体系的な方法の欠如に対処する。

arxiv arXiv cs.AI · 24日前

CSFSが再生可能エネルギー予測において計算コストを21%削減

研究者らは、風力および太陽光発電の予測における体系的な特徴量選択の欠如に対処するために設計された、新規でモデル非依存のラッパー手法であるクラスターベース逐次特徴量選択(CSFS)を提案する。このアプローチは、再生可能エネルギーパイプラインに対して自動的、効率的、かつ信頼性の高い特徴量選択を提供することを目指している。

arxiv arXiv cs.AI · 24日前 · 1 回表示

ViHoRec: 品質管理されたベトナム語ホテル推薦データセットとコールドスタートベンチマーク

研究者らは、ベトナム語のホテル推薦のための6,832人のユーザーと560件のホテル間の18,267件の相互作用からなる公開データセットViHoRecを発表しました。このリソースは、HMAC擬似名を用いたクロスプラットフォームエンティティ解決とプライバシー保護されたリリースにおける課題に対処しています。

arxiv arXiv cs.AI · 24日前

FormalAnalyticGeoはニューラル・シンボリックパイプラインを通じて多モーダル解析幾何学問題を生成する

研究者らは、人間の注釈を不要にする多モーダル解析幾何学問題の完全自動生成のためのスケーラブルなフレームワークであるFormalAnalyticGeoを発表しました。このシステムは、符号付き距離場エンジンを通じて問題文と正確な図のレンダリングをつなぐために、CDLと呼ばれる形式的な中間表現を利用しています。

arxiv arXiv cs.CL · 26日前 · 1 回表示

車載ブラジル手話認識用ICSLデータセットを研究者が公開

タクシーやライドシェアリングプラットフォームなどの共有モビリティサービス内で手話を使用する課題に対処するため、In-Car Sign Language (ICSL) コーパスと呼ばれる新しいマルチモーダルデータセットが導入されました。このリソースは、閉鎖された車内空間における難聴者およびろう者のコミュニティの公共交通アクセス向上を目指し、ブラジル手話 (Libras) に焦点を当てています。

arxiv arXiv cs.CL · 26日前

ドイツ語と英語の複合語の構成性における時間の経過に伴うわずかな負の傾向を研究が発見

研究者は、Compositionality Trend Predictionタスクを導入し、年代ごとの共時的評価からなる新規データセットに対して評価することで、23のドイツ語および26の英語の名詞複合語における意味変化を調査した。複合語が構成性を失う方向に決定的な傾向を示すとする既存の研究とは対照的に、本研究では時間の経過に伴うわずかな負の傾向のみが検出された。

arxiv arXiv cs.CL · 26日前

JobHop v2: 非構造化履歴書からの大規模なキャリア軌跡データセット

研究者らは、労働力計画や労働市場分析のために設計された公開済みのJobHopデータセットを改善したJobHop v2をリリースしました。オランダ語圏フラーム地方の公共雇用サービスであるVDABから提供された約44万枚の擬似匿名化された多言語履歴書からエンドツーエンドの大規模言語モデル抽出によって構築され、このデータセットには355,315件のキャリア軌跡が含まれています。

arxiv arXiv cs.LG · 26日前

クラウドソーシングされたコレクションからキーワードを抽出するためのNLPアプローチを評価する研究

オックスフォード大学の「Their Finest Hour Online Archive」を使用したプロジェクトは、大規模なキーワード抽出を自動化するために、固有表現認識、キーワード抽出、トピックモデリングという3つの自然言語処理アプローチを評価しました。この研究では、従来の統計モデルから最新の生成AIニューラルネットワークに至るまで、さまざまな手法にわたってこれらの方法をテストしました。