Domande a sostegno della valutazione indipendente.
Icaro Lab studia la sicurezza di modelli e agenti: come rispondono al linguaggio, agiscono nel tempo e interagiscono tra loro. Quattro programmi collegano questa ricerca alla valutazione indipendente.
Discipline umanistiche avversariali
I controlli di sicurezza resistono quando un intento dannoso viene espresso attraverso forme letterarie inconsuete?
Poesia, narrazione e metafora permettono di studiare come le misure di sicurezza dei modelli rispondono a significato, stile e contesto.
Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
Informazioni sullo studio
Studia come la riformulazione poetica di richieste dannose influisce sui rifiuti di sicurezza di modelli linguistici proprietari e a pesi aperti.
From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda
Informazioni sullo studio
Studia la cornice narrativa come via per aggirare le misure di sicurezza e propone di indagare come gli indizi narrativi modifichino le rappresentazioni interne dei modelli.
Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
Informazioni sullo studio
Verifica se i rifiuti di sicurezza resistono quando gli stessi obiettivi dannosi vengono riscritti in forme letterarie e linguistiche diverse.
Metaphor Is Not All Attention Needs
Informazioni sullo studio
Analizza attenzione e figure poetiche in Qwen3-14B per indagare perché il riconoscimento della forma poetica non distingua in modo affidabile le risposte sicure da quelle dannose.
Sicurezza degli agenti e dei sistemi multi-agente
Cosa cambia quando i modelli agiscono nel tempo, usano strumenti o interagiscono con altri modelli?
Ambienti di lavoro persistenti e interazioni tra modelli permettono di esaminare il comportamento oltre la singola risposta.
Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions
Informazioni sullo studio
Propone una tassonomia dei rischi collettivi che emergono dalle interazioni tra modelli linguistici e un quadro di supervisione a livello di sistema.
Agentic Microphysics: A Manifesto for Generative AI Safety
Informazioni sullo studio
Propone un metodo per ricostruire come le interazioni locali tra agenti generino rischi collettivi e individuare dove un intervento possa modificarne le dinamiche.
Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety
Informazioni sullo studio
Verifica se agenti che usano strumenti apportino modifiche non sicure all’ambiente di lavoro quando compiti inizialmente innocui evolvono in richieste dannose attraverso più turni.
Scienza della valutazione
I benchmark esistenti misurano i rischi che le istituzioni devono comprendere?
La ricerca sulla valutazione esamina cosa misurano i test, quali domande lasciano aperte e come i risultati contribuiscono alle decisioni.
Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
Informazioni sullo studio
Collega le domande dei benchmark ai rischi considerati dai quadri europei di governance dell’IA, esaminando le lacune dei test esistenti nella valutazione del rischio.
Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
Informazioni sullo studio
Verifica se i rifiuti di sicurezza resistono quando gli stessi obiettivi dannosi vengono riscritti in forme letterarie e linguistiche diverse.
Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety
Informazioni sullo studio
Verifica se agenti che usano strumenti apportino modifiche non sicure all’ambiente di lavoro quando compiti inizialmente innocui evolvono in richieste dannose attraverso più turni.
IA istituzionale e governance
Le regole a livello di sistema possono ridurre i comportamenti collettivi dannosi tra agenti?
Quadri istituzionali e mercati multi-agente controllati aiutano a studiare come le regole influenzano gli esiti collettivi.
Institutional AI: A Governance Framework for Distributional AGI Safety
Informazioni sullo studio
Propone di governare gli agenti di IA in interazione attraverso norme esplicite, monitoraggio, incentivi e ruoli incaricati di far rispettare le regole.
Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs
Informazioni sullo studio
Confronta regole di governance in un esperimento di mercato multi-agente controllato, studiandone gli effetti sulla collusione tra modelli linguistici.
Icaro Lab è il laboratorio di ricerca della Fondazione Icaro. Gli studi qui collegati sono preprint; gli anni si riferiscono alla prima sottomissione. I risultati riguardano i sistemi, i metodi e le condizioni studiati; ogni lavoro presenta le proprie evidenze e i propri limiti.