QuantVectorsは、ヒンディー語、マラーティー語、グジャラート語、ベンガル語、パンジャーブ語、タミル語、ウルドゥー語、テルグ語、オリア語、カンナダ語、マラヤーラム語、アッサム語など、インドのインディック言語からの注釈付きドキュメントデータセットを求めています。データセットには、請求書、領収書、公共料金請求書、支払い通知、パッキングリスト、商業請求書、クレジットメモの種類が含まれており、各言語あたり約400文書、人間による検証済み注釈、99%以上の精度が必要です。データセットは商用ライセンス可能であり、オープンソースまたは商用のいずれでも構いません。HuggingFaceデータセット、研究用データセット、またはこの分野を専門とするベンダーからの提供を求めています。
media
Hugging Face Forums
·
93日前
·
open_models
インドのAI/OCRトレーニング用のインディック言語ドキュメントデータセットを探しています
翻訳元 English → 日本語
関連記事
media
Hugging Face Forums
·
29日前
·
39 回表示
vldmrbeskが測定された認識精度を伴う5万1千枚のツィオルコフスキー資料集を公開
コンスタンチン・ツィオルコフスキーの完全な個人アーカイブが、CC0データセットとして公開されました。このアーカイブは5万1,008枚のシートと2,019件のアーカイブファイルで構成され、独学でロケット理論を研究した人物の50年分の作品を網羅し、手書き原稿とタイピングされた写本を含みます。
media
r/LocalLLaMA
·
61日前
·
56 回表示
Hugging Face、最大のオープンコードデータセット「The Stack v3」をリリース
Hugging Faceは、これまでに最も大きなオープンコードデータセットであるThe Stack v3をリリースしました。本リリースでは、異なるユーザーのニーズに対応するため、2つの異なるアクセス方法が提供されます。
lab
IBM Research (Granite)
·
68日前
·
31 回表示
IBMがCodeAlchemyをオープンソース化:高品質なコードの大量合成データセット
IBMは、コードと実行トレースをペアリングすることでAIモデルのパフォーマンスを向上させるパイプラインおよび合成データセットであるCodeAlchemyをオープンソース化した。今回のリリースでは、15のプログラミング言語にわたる約1兆トークンが含まれており、その規模はWikipediaの少なくとも200倍に相当する。
arxiv
arXiv cs.CL
·
80日前
·
27 回表示
MultiSynt/MT が36言語にわたる4.8Tトークンの並列コーパスをリリース
研究者らは、36のヨーロッパ言語において約4.8兆語のターゲット言語トークンを含むオープンな合成並列コーパスである MultiSynt/MT を発表した。このデータセットは、Tower+ および OPUS-MT/HPLT-MT システムを用いて1000億の高品質な Nemotron-CC トークンを翻訳することで生成された。
blog
Simon Willison
·
81日前
·
22 回表示
Current AI、オープンソースAIギャップマップv0.1を421件の製品で公開
2025年2月のAI Action Summitで設立された非営利団体Current AIは、オープンソースAIの状況を索引付けするための「Open Source AI Gap Map v0.1」をリリースしました。