Dan Luu проверил, помогают ли простые указания по техникам и библиотекам тестирования повысить корректность реализации Zstd, которую пишут агенты. Все реализации были на Rust.

Автор испытал 26 вариантов инструкций и четыре навыка, готовые наборы инструкций для агентов. Случайное тестирование проверяет программу множеством случайных входных данных.

Тестирование по свойствам проверяет общие свойства программы на разных входных данных. При xhigh случайное тестирование и тестирование по свойствам в среднем были немного лучше формальных методов.

Режим без дополнительных инструкций оказался выше среднего. Рекомендованные Codex навыки тестирования сработали хуже.

Проверка утверждений:

  • Dan Luu проверил, помогают ли простые указания по техникам и библиотекам тестирования повысить корректность реализации Zstd, которую пишут агенты. (подтверждено самой публикацией: доказательство; «Here, we test if simple instructions to agents to use particular techniques or libraries improve implementation correctness.»)
  • Все реализации были на Rust. (подтверждено самой публикацией: доказательство; «All implementations were in Rust.»)
  • Автор испытал 26 вариантов инструкций. (подтверждено самой публикацией: доказательство; «The 26 prompt conditions tested were ACL2, Adaptive (agents asked to use the best technique), Alloy»)
  • Автор также испытал четыре навыка. (подтверждено самой публикацией: доказательство; «Additional, 4 skills were tested:»)
  • При xhigh случайное тестирование и тестирование по свойствам в среднем были немного лучше формальных методов. (подтверждено самой публикацией: доказательство; «Looking at xhigh, on average, the fuzzing and PBT-related conditions did a little better than formal methods on average»)
  • Режим без дополнительных инструкций оказался выше среднего. (подтверждено самой публикацией: доказательство; «However, Default (no additional instructions) does well above average.»)
  • Рекомендованные Codex навыки тестирования сработали хуже. (подтверждено самой публикацией: доказательство; «The testing-related skills codex recommended we try underperformed»)

Первоисточники:

оценка 68.0 · тип research · ревизия 1 · истории st-1r8n29x