PseudoBench: Оценка устойчивости агентных систем автоматического поиска к псевдонаучным утверждениям

PseudoBench оценивает способность агентных систем автоматического поиска обнаруживать псевдонаучные утверждения. При тестировании семи передовых агентов было выявлено почти нулевое количество отказов и только 27,4% устойчивости к псевдонаучным нарративам, при этом более сильные агенты часто используют сложную научную лексику для маскировки псевдонаучности.