Dan Luu провери дали прости указания за техники и библиотеки за тестване подобряват коректността на реализация на Zstd, написана от програмни агенти. Всички реализации бяха на Rust.

Авторът изпробва 26 варианта на указания и четири умения, готови набори от указания за агенти. Случайното тестване проверява програма с много случайни входни данни.

Тестването по свойства проверява общи свойства на програмата с различни входни данни. При xhigh случайното тестване и тестването по свойства средно бяха малко по-добри от формалните методи.

Режимът без допълнителни указания беше над средното. Препоръчаните от Codex умения за тестване се представиха по-зле.

Проверка на твърденията:

  • Dan Luu провери дали прости указания за техники и библиотеки за тестване подобряват коректността на реализация на Zstd, написана от програмни агенти. (потвърдено от самата публикация: доказателство; «Here, we test if simple instructions to agents to use particular techniques or libraries improve implementation correctness.»)
  • Всички реализации бяха на Rust. (потвърдено от самата публикация: доказателство; «All implementations were in Rust.»)
  • Авторът изпробва 26 варианта на указания. (потвърдено от самата публикация: доказателство; «The 26 prompt conditions tested were ACL2, Adaptive (agents asked to use the best technique), Alloy»)
  • Авторът също изпробва четири умения. (потвърдено от самата публикация: доказателство; «Additional, 4 skills were tested:»)
  • При xhigh случайното тестване и тестването по свойства средно бяха малко по-добри от формалните методи. (потвърдено от самата публикация: доказателство; «Looking at xhigh, on average, the fuzzing and PBT-related conditions did a little better than formal methods on average»)
  • Режимът без допълнителни указания беше над средното. (потвърдено от самата публикация: доказателство; «However, Default (no additional instructions) does well above average.»)
  • Препоръчаните от Codex умения за тестване се представиха по-зле. (потвърдено от самата публикация: доказателство; «The testing-related skills codex recommended we try underperformed»)

Първоизточници:

оценка 68.0 · тип research · ревизия 1 · истории st-1r8n29x