Dan Luu провери дали прости указания за техники и библиотеки за тестване подобряват коректността на реализация на Zstd, написана от програмни агенти. Всички реализации бяха на Rust.
Авторът изпробва 26 варианта на указания и четири умения, готови набори от указания за агенти. Случайното тестване проверява програма с много случайни входни данни.
Тестването по свойства проверява общи свойства на програмата с различни входни данни. При xhigh случайното тестване и тестването по свойства средно бяха малко по-добри от формалните методи.
Режимът без допълнителни указания беше над средното. Препоръчаните от Codex умения за тестване се представиха по-зле.
Проверка на твърденията:
- Dan Luu провери дали прости указания за техники и библиотеки за тестване подобряват коректността на реализация на Zstd, написана от програмни агенти. (потвърдено от самата публикация: доказателство; «Here, we test if simple instructions to agents to use particular techniques or libraries improve implementation correctness.»)
- Всички реализации бяха на Rust. (потвърдено от самата публикация: доказателство; «All implementations were in Rust.»)
- Авторът изпробва 26 варианта на указания. (потвърдено от самата публикация: доказателство; «The 26 prompt conditions tested were ACL2, Adaptive (agents asked to use the best technique), Alloy»)
- Авторът също изпробва четири умения. (потвърдено от самата публикация: доказателство; «Additional, 4 skills were tested:»)
- При xhigh случайното тестване и тестването по свойства средно бяха малко по-добри от формалните методи. (потвърдено от самата публикация: доказателство; «Looking at xhigh, on average, the fuzzing and PBT-related conditions did a little better than formal methods on average»)
- Режимът без допълнителни указания беше над средното. (потвърдено от самата публикация: доказателство; «However, Default (no additional instructions) does well above average.»)
- Препоръчаните от Codex умения за тестване се представиха по-зле. (потвърдено от самата публикация: доказателство; «The testing-related skills codex recommended we try underperformed»)
Първоизточници:
оценка 68.0 · тип research · ревизия 1 · истории st-1r8n29x