Training data
arxiv arXiv cs.AI · 5時間前 · 10 回表示

VideoX-Qwenが指示ベースのビデオ編集のためのデータ中心フレームワークを導入

研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。

media MarkTechPost · 18日前 · 27 回表示

Adaption Labsが「Invent a Dataset」をリリースし、タスク記述からトレーニングデータを生成

Adaption Labsは、シードコーパス、事前定義されたスキーマ、またはラベリングガイドを必要とせず、自然言語のタスク記述から構造化されたトレーニング準備完了のデータセットを直接生成する機能「Invent a Dataset」を発表しました。このツールはAdaptionアプリ、Python SDK、REST APIを通じて利用可能で、ユーザーは生成された行をJSONL、JSON、CSV、またはParquet形式でダウンロードできます。

media Hugging Face Forums · 23日前 · 29 回表示

チュートリアル: 基礎からバイトレベルのBPEトークナイザーを構築・学習する

新しいチュートリアルでは、第一原理からバイトレベルのBPEトークナイザーを構築し学習する手順が文書化されています。ガイドでは、Unicode対応の事前トークン化、ペア頻度のインクリメンタル更新、遅延削除付き最大ヒープの使用など、実装の重要な詳細がカバーされています。

lab Hugging Face Blog · 25日前 · 36 回表示

Open ASR リーダーボードにヒンディー語およびインド英語用のMonsoonデータセットが追加

Open ASR リーダーボードは、2つの新しい評価セットである Monsoon en-IN(インド英語)と Monsoon hi-IN(ヒンディー語)を通じて、初のグローバルサウス言語を導入しました。これらの追加により、歴史的にヨーロッパの言語に焦点を当ててきた現在のベンチマークにおける人口統計的多様性の欠如という課題に対応します。

media Hugging Face Forums · 28日前 · 40 回表示

Harmonic Frontier が Celtic Constellation Reference Sessions データセットのプレビューをリリース

Harmonic Frontier は、伝統的および現代のケルトアンサンブル編曲のアライメントされたマルチトラック録音を含む Celtic Constellation Reference Sessions データセットのプレビューを公開しました。アーキテクチャはアライメントされたペアで構成され、各作品にはドライな分離ステム、制作チェーンを通じて処理された同じパフォーマンス、そして完成したミックスが含まれます。

media Hugging Face Forums · 29日前 · 39 回表示

vldmrbeskが測定された認識精度を伴う5万1千枚のツィオルコフスキー資料集を公開

コンスタンチン・ツィオルコフスキーの完全な個人アーカイブが、CC0データセットとして公開されました。このアーカイブは5万1,008枚のシートと2,019件のアーカイブファイルで構成され、独学でロケット理論を研究した人物の50年分の作品を網羅し、手書き原稿とタイピングされた写本を含みます。