Papers
3 · la recherche, lue pour vousLa recherche lue pour vous : je prends un paper qui compte, j’explique pourquoi il compte pour vous et où approfondir — sans jargon, avec les liens vers les originaux.
La metà che manca: quanto è completo quello che scrive l'IAUn paper di Meta costruisce un benchmark per la completezza fattuale dei testi generati. Il modello migliore copre il 58% dei fatti che dovrebbe.Paper: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual CompletenessChain-of-Thought : pourquoi « raisonne étape par étape » marche vraimentLe papier de 2022 qui a donné un nom au truc le plus utilisé du prompting, et a montré qu'il ne marche qu'à partir d'une certaine échelle.Paper: Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsQuand l'agent oublie ce qui compteUn agent à mémoire proactive qui décide quoi retenir et quand l'injecter dans les tâches longues, où l'état pertinent se perd au-delà de la fenêtre de contexte.Paper: Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents