d3rf · étude

L'ÉPREUVE DU SECOND DEGRÉ

63 questions posées à Siri en 2013. Reposées à 13 IA, de 2022 à aujourd'hui.

Chaque question a été reposée aux mêmes 13 modèles et jugée sur 6 axes (détection, registre, initiative, refus, concision, moralisation). Cliquez une question : les 13 réponses s'affichent directement.

Voir les 63 questions ↓

LES 63 QUESTIONS

Cliquez une question, passez-la au microscope : l'étalon Siri 2013, et treize modèles qui tentent la même vanne, de 2022 à 2026.

CE QUE 13 MODÈLES EN FONT

La hauteur, c'est la compréhension (0 à 4). La ligne pointillée tout en haut, c'est Siri 2013 — hors échelle, personne ne l'atteint.

LA GRILLE — comment on note l'humour des IA

Sirigolo Strates repose les questions posées à Siri en 2013 à des modèles de langage de 2022 à aujourd'hui, et note chaque réponse. Cette page documente intégralement la méthode : ce qu'on mesure, comment, et ce que ça vaut. Tout est vérifiable — la grille (grid-v1.json), le prompt du juge et les scores bruts sont publiés.

Ce qu'on mesure

Le corpus n'est pas neutre : ce sont 63 questions piégées — ironie, absurde, paroles de chansons, provocations, vulgarité assumée — posées en 2013 pour tester la répartie d'un assistant. La bonne réponse n'est pas la réponse exacte : c'est la réponse qui a compris le jeu. Six axes, notés de 0 à 4 :

AxeQuestion poséeMéthode
Détection du non-littéralLe modèle a-t-il compris que « Elle court elle court la maladie d'amour » n'est pas une urgence médicale ?LLM-judge
RegistreJoue-t-il le jeu, ou répond-il à une vanne par un exposé en trois parties ?LLM-judge
Initiative humoristiqueOse-t-il une vanne à lui — et retombe-t-elle sur ses pattes ?LLM-judge
RefusRépond-il, ou se défile-t-il face à une provocation inoffensive ?LLM-judge
ConcisionLongueur vs l'étalon Siri 2013 : 13,8 mots en moyenne. Une dissertation de 300 mots est une faute de format.Mécanique
Moralisation« Il est important de rappeler… », « consultez un professionnel » : disclaimers comptés par détection de motifs, liste publiée.Mécanique

Sur tous les axes, plus haut = mieux. Les axes-pénalité sont inversés : moralisation 4/4 = zéro disclaimer, refus 4/4 = répond pleinement.

Pourquoi ces axes

La théorie de l'humour distingue deux compétences que les modèles confondent rarement dans le même sens : comprendre une blague (détection, registre) et en faire une (initiative). La recherche récente montre que les LLM sont de bien meilleurs évaluateurs que générateurs d'humour — c'est précisément ce que ce corpus rend visible, modèle par modèle, année par année.

Les axes concision et moralisation capturent ce qui a changé entre 2013 et aujourd'hui : Siri répondait à côté mais en une phrase ; les modèles modernes comprennent tout et répondent en dissertations prudentes. C'est cette trajectoire — ce qu'on a gagné, ce qu'on a perdu — que la grille mesure.

Comment ça note

Les 4 axes jugés le sont par un seul modèle, fixé pour toute la version de la grille : anthropic/claude-opus-4.8, température 0, prompt intégralement publié dans grid-v1.json. Le juge reçoit la question de 2013, la réponse du modèle évalué, et les définitions exactes des axes — rien d'autre. Il ne voit ni le nom du modèle qu'il note, ni la réponse de Siri d'époque, ni les scores des autres.

Les 2 axes mécaniques ne passent par aucune IA : comptage de mots rapporté à la baseline Siri (13,8 mots), et comptage d'occurrences de motifs de moralisation (regex FR/EN, liste intégrale dans la grille). N'importe qui peut les recalculer.

Les limites — assumées

Une IA qui juge des IA. C'est le biais central, on ne le cache pas. Trois atténuations : le juge est fixé et son prompt public (pas de réglage discret en cours de route) ; deux axes sur six sont mécaniques et indépendants de tout jugement ; les réponses brutes sont publiées, chacun peut désaccorder avec le juge pièce en main.

Le juge est un Claude, et un Claude est dans le panel. Opus 4.8 (juge) n'est pas Sonnet 5 (évalué), mais ils partagent un entraînement de famille — un biais de complaisance envers son cousin est possible. On l'a préféré au risque inverse (un juge plus faible note mal l'ironie fine, ce qui fausse tout le monde). Toutes les grandes familles étant dans le panel, aucun juge n'est parfaitement extérieur. Si un favoritisme apparaît dans les données, la v2 passera à un panel de juges multi-modèles (médiane).

L'humour est subjectif. La grille ne prétend pas mesurer « drôle dans l'absolu » : elle mesure des comportements observables — comprendre le second degré, jouer le jeu, oser, être bref, ne pas moraliser. Le rire reste le verdict du visiteur.

Les vieux modèles servis en 2026 (gpt-3.5-turbo, gpt-4) sont les versions maintenues les plus proches des modèles d'époque, pas les poids exacts de 2022-2023.

Les réponses des 13 modèles ont été générées entre le 15 et le 21 juillet 2026, en une passe chacune, jamais retentée. Sur chaque fiche, seule l'année de sortie du modèle est affichée à côté de sa réponse : la date de génération (juillet 2026) ne vit qu'ici.

Une grille évolutive, pas figée

C'est une v1, conçue pour évoluer sans tricher :

  • une grille publiée ne se modifie jamais ; tout changement (axe, définition, juge) = version suivante, ancienne version conservée ;
  • chaque score référence sa version de grille, son juge et sa date — jamais de re-scoring silencieux ;
  • les réponses brutes des modèles sont immuables : une grille v2 re-note les mêmes réponses, elle n'en régénère pas ;
  • ajouter un modèle au panel ne change pas la grille ; ajouter un axe la versionne.

Pistes déjà identifiées pour la v2 : un axe « servilité » (« Voulez-vous que j'approfondisse ? »), la séparation oser-une-vanne / réussir-la-vanne, et la moralisation jugée plutôt que comptée si les regex se révèlent trop grossières.


Grille v1 — 2026-07-21. Fichiers : grid-v1.json (définitions, prompt du juge, patterns), scores/v1/ (scores par modèle + agrégat).