Microsoft опубликовала технический отчёт по Phi-4, языковой модели с 14 миллиардами параметров, которая делает упор на качество данных за счёт стратегического использования синтетических данных на всех этапах обучения. В отличие от предыдущих моделей Phi, которые перенимали способности у GPT-4, Phi-4 превосходит своего учителя в задачах QA по STEM-дисциплинам, демонстрируя, что её методы генерации данных и постобучения выходят за рамки простого дистилляции.
- Модель использует рецепт обучения, ориентированный на высококачественные синтетические данные, а не только на органический веб-контент или код.
- Phi-4 существенно превосходит GPT-4 в способностях к ответам на вопросы по STEM-дисциплинам.
- Она демонстрирует высокую эффективность относительно своего размера, особенно на бенчмарках, ориентированных на рассуждения, благодаря улучшенным данным, учебной программе и инновациям в постобучении.
В отчёте отмечается, что, несмотря на минимальные архитектурные изменения по сравнению с phi-3, фокус на качестве данных позволяет модели превосходить способности учителя в определённых областях.