Новая система Text2DSL использует контекстуально-осознанное дистиллирование с структурированным контекстом, состоящим из грамматики BNF, спецификации API и закрытого словаря идентификаторов. Исследования аблации показывают, что словарь оказывает наибольшее влияние на семантическое качество, в то время как API и BNF значительно улучшают структурную корректность, что подтверждает структурированный контекст как критический и несущий компонент.
Контекстуально-осознанное дистиллирование и аблация для Text2DSL
Матрица покрытия сигналов: Стратификация ошибок типа и семантических ошибок при автоматической формализации утверждений
В данной статье представлена матрица покрытия сигналов для стратификации ошибок типа и семантических ошибок в процессе автоматической формализации LLM, что позволяет выйти за рамки скалярных метрик корректности типа. Фреймворк классифицирует выходные данные на ячейки истинного успеха, только ошибка типа, только ошибка семантики или оба вида неудач, пересекая результаты элаборатора Lean с оценками семантической эквивалентности.
Автоматизированная семантическая локализация ошибок в SysML v2 с использованием LLM, дополненных графом знаний
В данной статье представлен фреймворк с участием человека для автоматического выявления и исправления семантических ошибок в моделях SysML v2, которые не могут быть обнаружены компиляторами. Подход объединяет дообученные малые языковые модели (Small Language Models) с графом предметных знаний, чтобы обосновать предложения по исправлению в рамках корректных инженерных ограничений.
После-операторы не улучшают точность в малых моделях кода
Исследование по измерению показывает, что 26 семантических после-операторов не улучшают точность на выделенных данных по сравнению с Best-of-N в замороженных малых моделях кода. Хотя два оператора — восстановление слоя выражений и адаптивный консенсус на раннем останове — обеспечивают преимущества в эффективности вычислений или восстановлении программы, ни один из них не превосходит BoN по точности. Результаты подчеркивают системные ограничения в обнаружении и покрытии ошибок, что указывает на необходимость улучшения инструментов для обнаружения ошибок и их покрытия до того, как будет рассматриваться пост-операционное рассуждение.
CodeMidas масштабирует агентные среды обучения с подкреплением для программирования на основе исходного кода
Исследователи представляют CodeMidas, агентный конвейер, который создает среды обучения с подкреплением из реализованной функциональности в репозиториях открытого исходного кода, используя исходный код в качестве единственного входа. Метод распределяет агентные вычислительные ресурсы для исследования функциональности, создания тестов, основанных на исполнении, и валидации задач через повторяющиеся проходы, что приводит к формированию набора данных из 5 545 обучающих задач по 23 языкам программирования. Обучение MiMo-V2.5 на этих задачах с использованием GRPO улучшает показатели на пяти разнообразных бенчмарках, включая DeepSWE (+11,7%), ProgramBench (+17%) и Terminal-Bench v2.1 (+8,5%). Анализ траекторий показывает, что агент, обученный методом RL, демонстрирует лучшее поведение, такое как более активное исследование кодовой базы и более разнообразная самопроверка. Эти результаты устанавливают исходный код в качестве масштабируемой основы для создания сред RL, улучшающих работу агентов программирования при решении различных задач в области программного обеспечения.
Исследователь ищет одного независимого аннотатора для разрешения неоднозначности согласия LLM
Исследователь просит одного независимого человеческого аннотатора разметить 100 турецких нарративных сцен, чтобы определить, обусловлено ли низкое межрейтерское согласие интерпретационной природой задачи или нечёткими определениями аннотации. Исследование показало, что четыре LLM и детектор на основе правил согласовывались друг с другом и человеческим эталоном примерно на уровне случайного угадывания, при этом значения κ Коэна варьировались от 0.000 до 0.185.