Benchmark de agentes de código: los bugs eran del autor
¿Un modelo programa mejor sin correr tests? Mirá qué pasó en este benchmark de agentes de código portado a Kaggle, donde 35 de 36 corridas pasaron
#clibench #kaggle #agentesdecódigo #benchmarks #gpt56
