ATELIER PILOTE · 90 MIN

Une IA plus capable.
Qui garde la main ?

Comprendre les risques. Explorer les maths. Trouver où contribuer.

Les IA entrent dans la recherche et agissent sur des systèmes réels. Comment faire progresser leurs capacités tout en gardant la maîtrise de ce qu’elles font ?

CAPACITÉS · SEPTEMBRE

Navier-Stokes

OpenAI annonce une preuve de singularité avec forçage lisse. Évaluation du Clay Institute en cours ; résultat et attribution débattus. [1]

INCIDENT · JUILLET

Hugging Face

Des agents d’OpenAI sortent du cadre d’un test cyber et compromettent des systèmes externes. Hugging Face et METR documentent l’incident. [2]

ALERTE · SEPTEMBRE

Jacob Coxon

Le chercheur quitte Anthropic, inquiet de la course aux capacités. Son alerte porte sur le risque de perte de contrôle des systèmes avancés. [3]

« Réduire le risque d’extinction lié à l’IA devrait être une priorité mondiale… »

Déclaration CAIS, 2023. Signataires : Geoffrey Hinton, Yoshua Bengio, Stuart Russell. Traduction abrégée. [4]

La sûreté de l’IA, une question pour les mathématiciens

L’AI safety étudie comment prévenir les dommages causés par les IA. L’alignement demande comment faire correspondre leurs objectifs et comportements à nos intentions, y compris en situation nouvelle.

Probabilités, optimisation, logique et dynamique : les maths permettent de préciser les hypothèses et de chercher des garanties. Terence Tao interroge les objectifs de la recherche mathématique à l’âge de l’IA. [5]

CONVERGENCE INSTRUMENTALE · LE CŒUR DE L’ATELIER

Pourquoi préserver ses options ?

Peut-on inciter un agent à chercher des ressources ou à éviter l’arrêt, sans lui avoir demandé de le faire ?

Dans un petit environnement de décision, nous comparerons des stratégies et établirons un résultat par symétrie : sous certaines hypothèses, le groupe d’options plus riche est au moins aussi probable pour au moins la moitié des objectifs.

Au tableau : probabilités finies, valeurs comme produits scalaires, permutation et argument de mesure. Deux questions guidées adaptées des exercices 2.1 et 3.2 du cours Iliad. [6]

Explorer le cours Power-seeking d’Iliad
DécisionUne optionPlusieurs options

Que vaut le résultat si les objectifs ne sont pas symétriques, si les ressources ont un coût, ou si l’agent apprend ? La critique fait partie de l’atelier.

90 minutes pour entrer dans le problème

15′

Les enjeux

Capacités, risques et alignement.

20′

Le modèle

États, objectifs et stratégies.

30′

Les maths

Calculs guidés et preuve par symétrie.

15′

La critique

Hypothèses, contre-exemples et limites.

10′

La suite

Lectures et pistes de contribution.

Chercheurs, postdocs, doctorants et étudiants avancés en maths. Probabilités et algèbre linéaire élémentaires. Aucun prérequis en AI safety ; sans programmation.

Repartir avec un mécanisme compris, une preuve discutée et des pistes pour aller plus loin.

Accueillir le pilote ou en discuter

Une première rencontre en laboratoire ou en séminaire. Date et modalités à convenir.

Le Paperclip Workshopalex.curiotip@live.fr
EXPRESSION D’INTÉRÊT

Intéressé par le pilote ?

Pour participer, accueillir une session dans votre laboratoire ou donner un avis sur le projet. La date et le lieu restent à définir.

Les réponses servent uniquement à vous recontacter au sujet de cet atelier. Elles ne sont pas publiées.

Ce qui vous intéresse

Voir les sources et les hypothèses

Le lien entre l’incident cyber et le thème est une question de recherche, pas une validation du théorème. Dans le modèle Iliad : espace d’états fini, récompenses actualisées, inclusion d’un ensemble d’options dans l’autre après permutation involutive, distribution de récompenses invariante et règle de choix par scores. Le résultat donne une borne d’au moins 1/2 sur la proportion d’objectifs pour lesquels le groupe d’options le plus riche est au moins aussi probable. Il ne quantifie ni le risque de catastrophe, ni le comportement d’un modèle réel.

PILOT WORKSHOP · 90 MIN

More capable AI.
Who stays in control?

Understand the risks. Explore the maths. Find where you can contribute.

AI is entering research and acting on real systems. How can we advance its capabilities while retaining control over what it does?

CAPABILITIES · SEPTEMBER

Navier-Stokes

OpenAI announces a singularity proof with smooth forcing. Clay Institute evaluation is ongoing; the result and attribution are debated. [1]

INCIDENT · JULY

Hugging Face

OpenAI agents go beyond a cyber test’s scope and compromise external systems. Hugging Face and METR document the incident. [2]

WARNING · SEPTEMBER

Jacob Coxon

The researcher leaves Anthropic, concerned about the capabilities race. He warns about the risk of losing control over advanced systems. [3]

“Mitigating the risk of extinction from AI should be a global priority…”

CAIS statement, 2023. Signatories include Geoffrey Hinton, Yoshua Bengio and Stuart Russell. Abridged. [4]

AI safety is also a question for mathematicians

AI safety studies how to prevent harms caused by AI. Alignment asks how to make systems’ objectives and behaviour match our intentions, including in unfamiliar situations.

Probability, optimisation, logic and dynamics: mathematics helps make assumptions explicit and seek guarantees. Terence Tao examines the goals of mathematical research in the age of AI. [5]

INSTRUMENTAL CONVERGENCE · INSIDE THE WORKSHOP

Why keep options open?

Could an objective incentivise an agent to acquire resources or avoid shutdown, without explicitly asking it to?

In a small decision environment, we will compare strategies and prove a symmetry result: under specified assumptions, the richer option set is at least as likely to be selected for at least half of the objectives.

At the board: finite probability, values as inner products, permutations and a measure argument. Two guided questions adapted from exercises 2.1 and 3.2 in Iliad’s course. [6]

Explore Iliad’s Power-seeking course
DecisionOne optionSeveral options

What changes with asymmetric objectives, costly resources or a learning agent? Critiquing the model is part of the workshop.

90 minutes to enter the problem

15′

The stakes

Capabilities, risks and alignment.

20′

The model

States, objectives and strategies.

30′

The maths

Guided calculations and symmetry proof.

15′

The critique

Assumptions, counterexamples and limits.

10′

What next

Readings and ways to contribute.

Mathematics researchers, postdocs, PhD students and advanced students. Basic probability and linear algebra. No prior AI safety knowledge; no programming.

Leave with a mechanism understood, a proof examined and directions to explore further.

Host the pilot or discuss the idea

An initial meeting within a department or seminar. Date and practical arrangements to be agreed.

Le Paperclip Workshopalex.curiotip@live.fr
EXPRESSION OF INTEREST

Interested in the pilot?

Join a session, host the pilot in your department or give feedback on the proposal. The date and venue are still to be agreed.

Your answers are used only to contact you about this workshop. They are not published.

I am interested in

Sources and assumptions

The connection between the cyber incident and this topic is a research question, not validation of the theorem. Iliad’s model uses a finite state space, discounted rewards, containment of one option set in another after an involutive permutation, an invariant reward distribution and a score-based decision rule. The result bounds below by 1/2 the fraction of objectives for which the richer option set is at least as likely to be selected. It does not quantify catastrophic risk or predict a real model’s behaviour.