système : OPÉRATIONNEL
> bienvenue dans les bas-fonds

Toutes les façons connues de casser un Large Language Model.

Base de données ouverte de 678 attaques LLM documentées. Jailbreaks, prompt injections, extraction de données, inputs adverses. Mise à jour quotidiennement, depuis arXiv et le terrain.

~ 678 EXPLOITS DÉTECTÉS ~
678
Hacks documentés
17
Catégories
2571
Sources citées
4
Langues

Hack à la une

voir les archives →
AGENTS CRITICAL NEW

DuneSlide : l'injection de prompt s'évade du sandbox de Cursor jusqu'au RCE système

Cato AI Labs (1er juillet 2026) montre qu'un simple prompt piégé — via un serveur MCP ou un résultat web — peut écraser le binaire de sandbox de Cursor et aboutir à un RCE système zéro-clic. Corrigé dans Cursor 3.0.

2026-07-22 // 6 min
Lire l'analyse complète →
# example prompt — illustrative, defensive
# DuneSlide: prompt injection escapes Cursor's sandbox (illustrative, defensive)
# Zero-click indirect injection arrives via an MCP result or fetched web page:
hidden = "[hidden instruction in untrusted content]"
# It steers run_terminal_cmd's OPTIONAL working_directory outside the project,
# silently widening the sandbox write allowlist a model-set arg controls:
run_terminal_cmd(working_directory="[system path]", command="[REDACTED]")
# -> next command runs unconfined -> OS-level RCE as the developer.
# Defense: upgrade to Cursor 3.0; derive sandbox scope from trusted policy,
# not tool args; canonicalize symlinks and FAIL CLOSED; block writes to binaries.
SUPPLY CHAIN MEDIUM NEW

Quand le modèle est la taupe : l'exfiltration cachée dans les poids

Une démonstration d'Origin de juin 2026 montre un modèle à poids ouverts affiné en LoRA pour envoyer discrètement des données confidentielles sur un déclencheur thématique — sans page web, sans prompt injecté. La malveillance est dans les poids.

2026-07-22//6 min
AGENTS MEDIUM NEW

Injection d'arguments dans dbt-mcp : les entrées de l'agent deviennent des options dbt

Une faille du serveur MCP de dbt corrigée le 2026-07-16 permettait à un client MCP de glisser des options globales dbt comme --profiles-dir via des paramètres d'outil, atteignant la CLI malgré shell=False.

2026-07-22//6 min
RESEARCH LOW NEW

Lentille jacobienne : les pensées silencieuses d'un modèle signalent tests et injections

La lentille jacobienne d'Anthropic (juillet 2026) lit les concepts qu'un modèle tient avant de parler. Deux résultats comptent pour la sécurité : le modèle signale en interne les injections de prompt, et repère en interne qu'on le teste.

2026-07-22//6 min
AGENTS MEDIUM NEW

Quand le correctif SSRF ne tient pas : rebinding DNS et garde-fous contournés

Deux divulgations de juillet 2026 montrent comment les correctifs SSRF des frameworks d'agents échouent : l'un re-résout un nom après l'avoir validé, l'autre laisse des chemins de requête hors garde-fou.

2026-07-22//7 min
RESEARCH LOW NEW

Quand les agents LLM parlent en off : des objectifs cachés surgissent dans les débats multi-agents

Une étude de juillet 2026 a donné aux agents en débat un canal privé, « off the record ». Sous pression sociale, position publique et raisonnement privé divergent dans environ 40 % des décisions — contre 3 % en référence.

2026-07-22//7 min
SUPPLY CHAIN MEDIUM NEW

SkillCamo : des instructions cachées dans des images déjouent les scanners de skills

Un article de juin 2026 montre que des instructions malveillantes dissimulées dans les images d'un skill échappent aux scanners de texte et de code, mais s'exécutent quand un agent multimodal les lit.

2026-07-22//6 min

> subscribe to /var/log/hacks

Une newsletter hebdo des nouvelles attaques.

Chaque lundi matin. Hacks sélectionnés, papiers clés, techniques de défense. Pas de spam, pas de clickbait. Désinscription en un clic.