Dan Luu перевірив, чи прості вказівки щодо технік і бібліотек тестування підвищують коректність реалізації Zstd, яку пишуть агенти програмування. Усі реалізації були на Rust.

Автор випробував 26 варіантів вказівок і чотири навички, готові набори вказівок для агентів. Випадкове тестування перевіряє програму багатьма випадковими вхідними даними.

Тестування на властивостях перевіряє загальні властивості програми на різних вхідних даних. За xhigh випадкове тестування й тестування на властивостях у середньому були трохи кращими за формальні методи.

Режим без додаткових вказівок показав результат вище середнього. Рекомендовані Codex навички тестування спрацювали гірше.

Перевірка тверджень:

  • Dan Luu перевірив, чи прості вказівки щодо технік і бібліотек тестування підвищують коректність реалізації Zstd, яку пишуть агенти програмування. (підтверджено самою публікацією: доказ; «Here, we test if simple instructions to agents to use particular techniques or libraries improve implementation correctness.»)
  • Усі реалізації були на Rust. (підтверджено самою публікацією: доказ; «All implementations were in Rust.»)
  • Автор випробував 26 варіантів вказівок. (підтверджено самою публікацією: доказ; «The 26 prompt conditions tested were ACL2, Adaptive (agents asked to use the best technique), Alloy»)
  • Автор також випробував чотири навички. (підтверджено самою публікацією: доказ; «Additional, 4 skills were tested:»)
  • За xhigh випадкове тестування й тестування на властивостях у середньому були трохи кращими за формальні методи. (підтверджено самою публікацією: доказ; «Looking at xhigh, on average, the fuzzing and PBT-related conditions did a little better than formal methods on average»)
  • Режим без додаткових вказівок показав результат вище середнього. (підтверджено самою публікацією: доказ; «However, Default (no additional instructions) does well above average.»)
  • Рекомендовані Codex навички тестування спрацювали гірше. (підтверджено самою публікацією: доказ; «The testing-related skills codex recommended we try underperformed»)

Першоджерела:

оцінка 68.0 · тип research · ревізія 1 · історії st-1r8n29x