NewTypeColaが66,010ページの韓国語VOKUアーカイブデータセットをリリース
NewTypeColaはHugging FaceにVOKU Archiveを公開しました。これは韓国の学生運営のキャンパスラジオ放送キューシート(cue sheets)から収集した66,010ページのスキャン画像コレクションです。文書は1988年から2019年まで spanning し、OCRテキスト、擬名トークン注釈、メタデータを含みます。
NewTypeColaはHugging FaceにVOKU Archiveを公開しました。これは韓国の学生運営のキャンパスラジオ放送キューシート(cue sheets)から収集した66,010ページのスキャン画像コレクションです。文書は1988年から2019年まで spanning し、OCRテキスト、擬名トークン注釈、メタデータを含みます。
研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。
計算言語学者でありハウサ語自然言語処理の専門家が、ハウサ語における医療と安全性の文脈で大規模言語モデルを評価するために設計された新しいデータセットを導入しました。
FlyEyeプロジェクトは、ブラウザおよびランタイム用開発キットと共に、初のコンパクトなニューロンレベルデータセットを公開しました。このリリースには、Hugging FaceにホストされているTubban/flyeye-escape-neuron-v1データセットが含まれます。
Adaption Labsは、シードコーパス、事前定義されたスキーマ、またはラベリングガイドを必要とせず、自然言語のタスク記述から構造化されたトレーニング準備完了のデータセットを直接生成する機能「Invent a Dataset」を発表しました。このツールはAdaptionアプリ、Python SDK、REST APIを通じて利用可能で、ユーザーは生成された行をJSONL、JSON、CSV、またはParquet形式でダウンロードできます。
著者らは、実世界での展開を対象としたAI支援型臨床試験推奨システムであるTrialGPT 2.0を発表し、患者のニーズとワークフローの優先度に基づいてどの試験を検討に値するかを評価する。