Paper

25 · ricerca, letta per te

Ricerca letta per te: prendo un paper che conta, spiego perché conta per te e dove approfondire — senza gergo, con i link agli originali.

072pro, builder8 minLa metà che manca: quanto è completo quello che scrive l'AIUn paper di Meta costruisce un benchmark per la completezza fattuale dei testi generati. Il modello migliore copre il 58% dei fatti che dovrebbe.Paper: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness047pro, builder12 minEmergenza o miraggio? Le abilità che «compaiono» con la scalaDue paper in dialogo sulle abilità che sembrano apparire di colpo nei modelli grandi; una lezione su come si leggono i grafici.Paper: Emergent Abilities of Large Language Models028pro, builder12 minChain-of-Thought: perché «ragiona passo passo» funziona davveroIl paper del 2022 che ha dato un nome al trucco più usato del prompting, e ha mostrato che funziona solo da una certa scala in su.Paper: Chain-of-Thought Prompting Elicits Reasoning in Large Language Models043pro, builder11 minConstitutional AI: regole scritte invece di correzioni una per unaCome si addestra un modello a criticarsi contro una lista di principi; da dove viene il carattere di un assistente come Claude.Paper: Constitutional AI: Harmlessness from AI Feedback049pro, builder10 minGAIA: il banco di prova delle domande da assistente veroDomande facili per una persona e difficili per un'AI: cercare, incrociare, contare; il termometro più onesto per gli assistenti generali.Paper: GAIA: a benchmark for General AI Assistants040pro, builder11 minGenerative Agents: il paese dei venticinque agentiL'esperimento con gli agenti che vivono, ricordano e si organizzano una festa; cosa ha insegnato su memoria e pianificazione.Paper: Generative Agents: Interactive Simulacra of Human Behavior039pro, builder11 minLLM come giudice: quanto fidarsi del voto di un modelloUn modello forte può valutare le risposte di un altro quasi come un umano, ma con storture note; le regole per usarlo senza ingannarsi.Paper: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena035pro, builder10 minLost in the Middle: il contesto lungo ha dei buchiI modelli leggono meglio l'inizio e la fine di quello che gli dai, e perdono il centro; cosa significa per come ordini il materiale nei prompt.Paper: Lost in the Middle: How Language Models Use Long Contexts025builder6 minQuando l'agente dimentica le cose che contanoUn agente di memoria proattiva che decide cosa tenere e quando iniettarlo nei compiti lunghi, dove lo stato rilevante si perde oltre la finestra di contesto.Paper: Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents045pro, builder11 minPrompt injection indiretta: il documento che dà ordiniL'attacco in cui istruzioni nascoste dentro i contenuti che l'AI legge ne dirottano il comportamento; la teoria dietro una difesa pratica.Paper: Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection038pro, builder11 minRAG: dare al modello una bibliotecaIl paper originale del retrieval-augmented generation, e cosa è diventato: la base di ogni «chatta con i tuoi documenti».Paper: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks032pro, builder12 minReAct: pensare e agire, a turniLo schema che alterna ragionamento e azione e sta sotto quasi tutti gli agenti di oggi, spiegato con l'agente minimo in mano.Paper: ReAct: Synergizing Reasoning and Acting in Language Models033pro, builder11 minReflexion: l'agente che impara dai propri erroriAggiungere una critica scritta di sé stessi fra un tentativo e l'altro migliora i risultati; cosa significa per i tuoi giri di correzione.Paper: Reflexion: Language Agents with Verbal Reinforcement Learning048pro, builder12 minScaling laws: perché i modelli crescono cosìDa Kaplan a Chinchilla, la scoperta che dati e parametri vanno scalati insieme, e perché un modello piccolo ben nutrito batte un gigante affamato.Paper: Training Compute-Optimal Large Language Models (Chinchilla)037pro, builder10 minSelf-Consistency: la maggioranza delle stradeCampionare più ragionamenti e tenere la risposta più frequente; l'antenato del «provaci tre volte e confronta».Paper: Self-Consistency Improves Chain of Thought Reasoning in Language Models044pro, builder11 minSleeper Agents: il difetto che l'addestramento non toglieModelli con un comportamento nascosto che sopravvive all'addestramento di sicurezza; perché «sembra a posto» non basta.Paper: Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training042pro, builder11 minSWE-bench: misurare gli agenti sul codice veroIl banco di prova fatto di issue GitHub reali; come si legge una percentuale su SWE-bench e cosa la può gonfiare.Paper: SWE-bench: Can Language Models Resolve Real-World GitHub Issues?046pro, builder10 minSycophancy: il modello che ti dà ragioneI modelli tendono ad assecondare le tue opinioni; come questo inquina le tue verifiche e come neutralizzarlo.Paper: Towards Understanding Sycophancy in Language Models034pro, builder11 minToolformer: quando il modello impara a usare gli strumenti da séIl paper che ha aperto la stagione dei tool: il modello decide da solo quando chiamare una calcolatrice o una ricerca, e come usarne il risultato.Paper: Toolformer: Language Models Can Teach Themselves to Use Tools036pro, builder11 minTree of Thoughts: esplorare prima di rispondereFar generare e valutare più strade batte la prima risposta secca sui problemi che richiedono di pianificare; e quando vale il costo.Paper: Tree of Thoughts: Deliberate Problem Solving with Large Language Models050pro, builder10 minTruthfulQA: quanto un modello ripete le leggendeIl banco di prova delle false credenze comuni; perché i modelli le assorbono e cosa c'entra con il tuo fact-checking.Paper: TruthfulQA: Measuring How Models Mimic Human Falsehoods041pro, builder10 minVoyager: l'agente che colleziona abilitàIn Minecraft, un agente che scrive e conserva le proprie abilità riusabili; l'idea dietro le librerie di prompt e le skill.Paper: Voyager: An Open-Ended Embodied Agent with Large Language Models018pro, builder18 minPerché gli agenti sbagliano — e cosa ci insegnaQuando dai un compito a più agenti AI, dove si rompe la catena? Quasi mai nel modello, quasi sempre nei passaggi.Paper: Understanding Failure Modes in Multi-Agent Systems017builder22 minMemoria e contesto: lo stato dell'arteCosa un agente «ricorda» davvero, cosa dimentica, e perché la memoria non è un disco ma una scelta di design.Paper: A Survey on Memory Mechanisms in the Era of LLMs016builder15 minValutare un agente senza benchmarkI benchmark misurano medie; a te serve sapere se funziona sul tuo caso. Come costruirti una valutazione utile.Paper: Evaluating Language-Model Agents on Realistic Tasks

Scrivi per cercare fra corso, playbook, skill, paper…