Adaption Labsは、シードコーパス、事前定義されたスキーマ、またはラベリングガイドを必要とせず、自然言語のタスク記述から構造化されたトレーニング準備完了のデータセットを直接生成する機能「Invent a Dataset」を発表しました。このツールはAdaptionアプリ、Python SDK、REST APIを通じて利用可能で、ユーザーは生成された行をJSONL、JSON、CSV、またはParquet形式でダウンロードできます。
- `datasets.invent`への単一の呼び出しが非同期生成を開始し、ドメインコード(例:医療)やサブドメインによって制御されます。
- 出力フォーマットには、教師ありファインチューニング用の`instruction_dataset`と、DPOのような好みに基づくトレーニング用の`preference_pairs`が含まれます。
- APIは`translate`または`localize`モードによる言語拡張をサポートし、0.01から1の間の構成可能なサンプルレートを備えています。
- 本番環境のパラメータには、クレジット確認用の`estimate`モード、10,000文字のプロンプト制限、安全な再試行のための冪等性キーが含まれます。
- 生成されたデータセットIDはAutoScientistに直接フィードされ、ユーザーの目的に対してデータとトレーニングレシピを共同最適化します。
Adaptionによると、このワークフローでAutoScientistを使用することは、手動で構成されたトレーニングよりも平均して35%優れており、Together AIが提供するアーキテクチャ上で8つの垂直分野全体で勝利率を48%から64%に引き上げています。