トピック · Training data
media Hugging Face Forums · 2日前 · 4 回表示

NewTypeColaが66,010ページの韓国語VOKUアーカイブデータセットをリリース

NewTypeColaはHugging FaceにVOKU Archiveを公開しました。これは韓国の学生運営のキャンパスラジオ放送キューシート(cue sheets)から収集した66,010ページのスキャン画像コレクションです。文書は1988年から2019年まで spanning し、OCRテキスト、擬名トークン注釈、メタデータを含みます。

arxiv arXiv cs.AI · 8日前 · 17 回表示

VideoX-Qwenが指示ベースのビデオ編集のためのデータ中心フレームワークを導入

研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。

media MarkTechPost · 26日前 · 32 回表示

Adaption Labsが「Invent a Dataset」をリリースし、タスク記述からトレーニングデータを生成

Adaption Labsは、シードコーパス、事前定義されたスキーマ、またはラベリングガイドを必要とせず、自然言語のタスク記述から構造化されたトレーニング準備完了のデータセットを直接生成する機能「Invent a Dataset」を発表しました。このツールはAdaptionアプリ、Python SDK、REST APIを通じて利用可能で、ユーザーは生成された行をJSONL、JSON、CSV、またはParquet形式でダウンロードできます。