Papers
3 · investigación, leída por tiInvestigación leída por ti: tomo un paper que importa, explico por qué te importa y dónde profundizar — sin jerga, con enlaces a los originales.
La mitad que falta: qué tan completo es lo que escribe la IAUn paper de Meta construye un benchmark para medir la completitud de los hechos en textos generados. El mejor modelo cubre solo el 58% de los hechos que debería incluir.Paper: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual CompletenessChain-of-Thought: por qué «razona paso a paso» funciona de verdadEl paper de 2022 que dio nombre al truco más usado del prompting, y mostró que solo funciona a partir de cierta escala.Paper: Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsCuando el agente olvida lo que importaUn agente de memoria proactiva que decide qué retener y cuándo inyectarlo en tareas largas, donde el estado relevante se pierde más allá de la ventana de contexto.Paper: Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents