Digital resources in the Social Sciences and Humanities OpenEdition Our platforms OpenEdition Books OpenEdition Journals Hypotheses Calenda Libraries OpenEdition Freemium Follow us

Optimal Transport for Actuarial Science (lecture notes)

Before leaving Kyoto to go back to Montréal (and enjoy some summer break), I uploaded some lecture notes, on Optimal Transport for Actuarial Science, on HAL (soon on ArXiv).

These lecture notes introduce optimal transport as a mathematical language for actuarial science. They treat losses, premiums, scores, reserves, capital scenarios, climate losses and lifetime distributions as probability measures that can be compared, transported, averaged, stressed and interpolated. The first part develops the main tools: couplings, push-forwards, discrete and continuous Kantorovich problems, duality, Wasserstein distances, quantile transport, barycenters, entropic regularization and statistical optimal transport. The second part applies these tools to risk measures, Wasserstein robustness, pricing and capital, portfolio drift, reserving cash-flow distributions, climate-prevention diagnostics, reinsurance, dependence uncertainty, capital allocation, distributional fairness diagnostics and longevity risk. Later chapters and appendices discuss counterfactual transport, dynamic formulations, unbalanced transport, Schrödinger bridges, cost engineering and computational labs in R. The emphasis is on actuarial modelling choices: the state space, the ground cost, the ambiguity radius, the reference distribution and the interpretation of the transport plan. Transport maps and couplings are used as distributional objects, not as causal claims unless additional assumptions are imposed.

The price of proof: insurance policies for an AI-enabled world

In The Actuary, the official magazine of the Institute and Faculty of Actuaries, in the UK, a short article.

AI is often discussed as a tool for insurers: a way to improve pricing, underwriting, fraud detection, claims management and customer service. But it is also becoming an object of insurance. Firms use AI systems in customer service, legal drafting, software development, marketing, finance, logistics, medical triage, compliance, credit decisions and operational workflows. These systems can generate losses due to erroneous advice, discriminatory decisions, privacy breaches, intellectual property disputes, cyber incidents, automated pricing errors, contractual liability, professional negligence, reputational harm or failures of autonomous agents.

It is true that AI creates a new risk, but only partly. Many of the problems it raises are familiar to insurers: limited historical data; fast evolving technology; opaque models. The insured may know more than the insurer, and service quality may be difficult to observe. Failures may be discovered only after deployment, and claims may involve complex questions of causation and responsibility. These are not new actuarial problems. Catastrophe insurance, cyber insurance, professional liability, product liability, and technology errors and omissions already involve uncertainty, model risk, asymmetric information and delayed discovery.

What is distinctive is the scale and structure of dependence. AI risk is not just a risk attached to one firm using one tool: many firms may rely on the same model, provider, cloud infrastructure, application programming interface (API), dataset, plugin or agent framework, so a single failure can produce many losses at once. This is the core accumulation problem. The insurer is not only underwriting the insured firm – it is indirectly underwriting part of the technological stack on which that firm depends.

This connects AI risk to cyber risk, but with an additional layer. Cyber insurance already struggles with common vulnerabilities, shared software, cloud concentration and network effects. AI adds common models and common behaviours. A faulty model update, compromised API, contaminated dataset, systematic retrieval failure or recurring hallucination pattern may affect many insureds simultaneously. The loss process is not independent across policyholders because policyholders share parts of the same AI supply chain.

To be continued…

29th International Congress on Insurance: Mathematics and Economics, 서울, June 2026

The 29th International Congress on Insurance: Mathematics and Economics (IME 2026) will be held in Seoul, I will present on Friday our joint work with Bertille Tierny and François Hu, Direct and Indirect Discrimination in Generalized Linear Models (the paper is available on arxiv)

Generalized linear models are central to actuarial modelling of binary risk, claim frequency, utilization, and cost-related outcomes. Yet fairness diagnostics often rely on linear-model intuitions, although GLM predictions are obtained by transporting a latent score through a nonlinear inverse link. We develop a moment-based decomposition framework for diagnosing group disparities in fitted GLM predictions. In an exact linear-Gaussian benchmark, the Wasserstein barycentric criterion for distributional demographic-parity violation reduces to a two-moment criterion and decomposes into direct mean, indirect mean, interaction, and structural components. For GLMs, we distinguish the empirical output-scale criterion U_2(f), a within-group proxy \widetilde U_2(f), and a leading decomposition D_1(f). This leading term preserves the four linear channels and adds two curvature components induced by the inverse link: curvature coupling and curvature amplification. We derive explicit formulas for logistic, Poisson, and Tweedie specifications and illustrate the diagnostic on medical-expenditure survey data. The framework is not a legal test of discrimination, nor a full characterization of distributional parity outside the linear-Gaussian case. It is a tractable actuarial diagnostic for identifying whether fitted prediction disparities arise from explicit sensitive effects, proxy-mediated covariate profiles, covariance-structure differences, or nonlinear link effects.

The slides are now available online.

International Workshop on Risk and Insurance, 서울, June 2026

In three weeks, the International Workshop on Risk and Insurance will be organized in 서울 (Seoul, Korea), prior to the Insurance: Mathematics & Economics conference. We were asked to send our slides in advance, so I thought I could be nice to share them (slides are available here). I will be the very first speaker of the day, in a session “AI Revolution and Cyber Risks”.

Over the past ten years, we have heard a lot about the AI revolution in actuarial science. Very often, the narrative is by technological optimism: more data, more models, more automation, and therefore better pricing, better decisions, and better insurance. In this talk, I plan to take a step back. Not to deny the importance of AI, of course, but to return to a more fundamental actuarial question: what makes a risk insurable? I will take two perspectives: first, information granularity and mutualization; second, AI itself as an insured exposure. The first part will be about granularity and mutualization. Insurance transforms individual heterogeneity into risk classes, but as information becomes more granular, the boundary between what is pooled and what is individualized shifts. I will move from information asymmetry to information granularity, then to natural catastrophe maps, and finally to actuarial fairness. In the second part, I will turn to AI risk in insurance: not AI as a tool for insurers, but AI as a risk that insurers may have to cover.

Let me start with the first part: granularity and mutualization. Insurance relies on a form of shared ignorance. We do not know who will have an accident, who will fall ill, or which house will be flooded. This uncertainty makes pooling possible. But ignorance is never complete. Actuaries observe variables, build classes, estimate frequencies, and price risks. The history of pricing is therefore a history of compromise between measuring heterogeneity and preserving mutualization. This slide gives a very classical way of seeing the problem. If there is a latent risk factor, which I call theta, total variance can be decomposed into within-risk variance and between-risk variance. The first part is the residual uncertainty that remains pooled. The second part is systematic heterogeneity across individuals or groups. But in practice, insurers do not observe theta. They observe covariates: age, location, car type, claim history, scores, and so on. These variables move part of the uncertainty from the insurer to the policyholder. The last formula is the key one. It separates irreducible risk from epistemic uncertainty, or misclassification. More granular information reduces misclassification, but it also turns pooled uncertainty into priced heterogeneity.

The classical issue in insurance economics is information asymmetry.  In Akerlof, or in Rothschild and Stiglitz, the problem is that policyholders may know more about their risk than insurers. If high-risk individuals buy more coverage than low-risk individuals, pooling contracts may become unstable. Empirically, this leads to a simple question: after controlling for observable risk characteristics, do coverage choices still predict losses? The genetic-testing debate makes this very concrete. Individuals may know something about their future risk that insurers cannot observe, or are not allowed to use. Traditionally, the fear was that policyholders knew too much. Today, with big data, we may also ask what happens when insurers know almost too much.

With granularity, the problem changes. It is no longer only about asymmetric information between the insured and the insurer. It is about reducing epistemic uncertainty. Things that were previously hidden become partially observable: behaviour, location, telematics, digital traces, health signals, and social proxies. Statistically, this is attractive: prediction improves. But actuarially and socially, it is more ambiguous. Better prediction also redistributes premiums, makes some risks more visible, and may turn solidarity into sorting. Removing protected variables is not enough. In rich data environments, proxies can reconstruct what we claim to exclude. So the question becomes normative: what should be priced, what should be pooled, and what should be used only for prevention? Note that the same issue arises with past criminal records: even if the information is predictive, should it remain admissible forever? Inclusive insurance requires a temporal dimension of data governance. Some information may be relevant at one point, but should progressively lose its underwriting legitimacy.

Natural catastrophes make this problem very concrete. For a long time, some climate risks were pooled at a broad scale. But risk maps, climate models, and fine geographic data now identify areas that are much more exposed than others. Even when a system is formally solidaristic, access to coverage may depend on the underlying household insurance contract. If insurers withdraw locally, or impose stricter conditions, formal solidarity may remain while effective access to insurance declines. So granularity does not only produce more accurate prices. It can also produce non-insurance, selective underwriting, or local market withdrawal.

This leads naturally to actuarial fairness. We often say that equal risks should pay equal premiums. But what does “equal risks” mean? Equal given all available information? Equal within a tariff class? Equal for a score? Equal within a protected group? Actuarial fairness is always relative to an information set. More granular information gives a more individualized notion of equality. Coarser information preserves more mutualization. This creates a tension between actuarial adequacy, solidarity, and causal legitimacy. A variable may be predictive without being socially acceptable. Conversely, excluding a variable may preserve solidarity, but at the cost of cross-subsidies and possibly selection.

I now move to the second part: AI risk in insurance. The link with the first part is this: so far, I have discussed AI and data as instruments of classification. But AI is also becoming a source of risk. Firms use models to code, advise, filter, recommend, automate, and decide. So the question is no longer only: how do insurers use AI? It is also: how do we insure organizations that use AI?

There is already a large discussion about AI for insurance: pricing, fraud detection, claims management, customer service. I want to reverse the perspective. AI is becoming an insured exposure. AI-related losses may not appear in a new line called “AI insurance.” They will appear through existing lines: cyber, technology E&O, professional liability, product liability, D&O, and regulatory risk. What is new is the combination of opacity, speed, scale, version changes, dependence on external providers, and difficult ex-post attribution. The actuarial question is not simply: what is the historical frequency of AI failures? The question is whether the risk can be bounded, observed, priced, monitored, and evidenced.

The first insurance problem is accumulation. A portfolio may look diversified: different firms, sectors, and countries. But they may all rely on the same models, APIs, cloud providers, datasets, retrieval systems, or agent frameworks. A model bug, a bad update, a prompt-injection vulnerability, a compromised API, or a provider failure can generate correlated losses across many insureds. This weakens the usual law-of-large-numbers intuition. Risks are not independent if they share the same technological infrastructure. Underwriting AI therefore requires mapping the AI supply chain: provider, model version, API, data, RAG system, agents, tools, and update process.

This slide introduces a recent report on AI risk prioritization. I would not take the probabilities literally; it is a study based on expert judgment. But it is useful because it frames AI risks as systemic, cross-sectoral, and unevenly distributed. The key point for insurance is the mismatch between vulnerability and control. The actors most exposed to harm are not necessarily those who control the models. Users, clients, and affected third parties may bear the consequences, while mitigation often depends on developers, providers, regulators, governments, or standards bodies. This raises a classical insurance question: who bears the risk, who controls the risk, and who can produce evidence after a loss?

Large language models (LLMs) are a particularly interesting case. The issue is not only hallucination. It also includes retrieval errors, prompt injection, privacy leakage, biased outputs, insecure code, incorrect tool use, and automation of decisions that should remain supervised. Benchmarks are not enough. They evaluate controlled tasks. Insurance deals with deployed systems, real users, real incentives, changing environments, and downstream losses. LLMs shift the cost of reliability. Producing an answer becomes cheap; verifying it may become expensive. And “human-in-the-loop” is not a magic control. A human can only control the system if they have time, competence, authority, and incentives to challenge the machine.

This brings me to a central point: insurability depends on proof. An insurance policy cannot simply say: “we cover AI risk.” It must define the insured system: the use case, model, version, provider, data source, retrieval layer, tools, agents, and update regime. It must also define evidence obligations: logs, audits, monitoring, incident reporting, version retention, red teaming, escalation procedures, and human review. Insurance can play a disciplinary role here. If nobody pays for proof before the loss, everybody pays for uncertainty after the loss. Conversely, if coverage depends on traceability, insurance creates an economic incentive to document and control AI systems.

I will end with vibe coding. Lawrence Lessig famously said that “code is law”, twenty five years ago: code does not only execute rules; it structures what is possible, impossible, easy, costly, visible, or invisible. But if code is generated by AI from prompts, modified quickly, integrated by agents, and sometimes deployed without serious human review, a new question appears: who can reconstruct the history of the code after a loss? The risk is not only that AI-generated code may be wrong. The risk is that nobody can say exactly what was asked, what was generated, which model version was used, which dependencies were added, which tests were run, and how the code reached production. For insurers, the right question is not: “Do you use AI to code?” Almost everyone will. The real question is: “Through which process can AI-generated code enter a critical system?” And this brings us back to very concrete underwriting tools: prompt logs, model versions, human review, tests, vulnerability scanners, SBOMs, deployment rules, and exclusions for unverified autonomous deployment. The broader conclusion is that AI does not eliminate classical actuarial questions. It makes them more visible: mutualization, accumulation, information asymmetry, evidence, moral hazard, control, and responsibility.

Pluralisme, balance, équilibre, et cirque médiatique

J’ai déjà parlé, ici ou , de mes souvenirs d’enfance et des cours de français au secondaire. En particulier de mon incompréhension assez profonde devant l’analyse de texte littéraire, où il fallait, me semblait-il, deviner les intentions de l’auteur, repérer des symboles que je ne voyais pas, attribuer à une tournure ou à une image une profondeur que je soupçonnais parfois d’être reconstruite après coup. La dissertation, à côté, me paraissait presque plus simple. Elle avait ses règles, ses figures imposées, son architecture reconnaissable. Je comprenais à peu près le jeu rhétorique du débat, ou du debating, que j’ai retrouvé plus tard en école : on pouvait toujours argumenter, quel que soit le sujet, et même quel que soit le point de vue qu’on nous demandait de défendre. Un peu comme dans le Gorgias de Platon, il y avait là une forme d’exercice de virtuosité : apprendre à soutenir une position, puis son contraire, montrer qu’on sait manier les arguments, retourner une objection, produire une apparence de symétrie.

Dans la dissertation scolaire, on nous a donc appris à opposer une thèse et une antithèse. Encore une fois, l’exercice n’était pas absurde en soi. Il obligeait à ne pas confondre conviction et démonstration, à reconnaître qu’un problème peut être abordé de plusieurs façons, à ne pas s’installer trop vite dans la certitude. Il y avait même quelque chose de salutaire dans cette discipline, on apprenait qu’un argument n’est pas simplement ce que l’on pense, mais ce que l’on peut justifier, on apprenait qu’une position adverse n’est pas nécessairement une absurdité, mais peut contenir une part de vérité ou, au moins, une objection sérieuse.  Depuis, j’ai appris à écrire autrement. De manière un peu autodidacte, sans doute, en lisant, en écrivant, en corrigeant, en étant corrigé. Mais l’écriture d’un article scientifique, ou même d’un essai un peu sérieux, ne ressemble pas du tout à ce vieux schéma thèse-antithèse-synthèse. En général, j’ai une thèse, je la pose, je la motive, j’essaie d’expliquer pourquoi elle mérite d’être prise au sérieux. Puis j’en cherche les limites. Je précise les hypothèses sous lesquelles elle tient, les cas où elle devient fragile, les objections qui m’obligent à la reformuler. Il ne s’agit pas de faire comme si deux positions se valaient a priori, mais de comprendre jusqu’où une proposition peut être défendue, à quelles conditions, avec quels degrés d’incertitude, et face à quelles objections.

Il me semble que c’est très différent. La pensée ne progresse pas parce qu’on a mécaniquement placé deux discours face à face. Elle progresse parce qu’on accepte de hiérarchiser, de qualifier, de contextualiser, de distinguer ce qui est établi, ce qui est plausible, ce qui est incertain, ce qui est simplement faux. Or le seul endroit où je retrouve aujourd’hui cette vieille construction scolaire de la thèse et de l’antithèse, c’est dans les débats télévisés ou radiophoniques. Si un invité avance une idée, il faut aussitôt lui opposer quelqu’un. Un scientifique vient expliquer l’état des connaissances, et il faut “équilibrer” avec une voix contraire. Un chercheur présente une enquête, et il faut un polémiste en face. Comme si l’information devait toujours prendre la forme d’un duel, et comme si la vérité naissait spontanément du choc de deux opinions mises en scène.  Un climatologue vient parler du réchauffement climatique, on lui oppose un climatosceptique médiatique. Un sociologue vient présenter une enquête, on lui oppose un polémiste. Un épidémiologiste explique un consensus médical, on invite “l’autre point de vue”. Le dispositif semble démocratique, chacun pouvant se faire une opinion. Mais si on y réfléchit deux secondes, tout est déjà joué dans la scénographie. Le simple fait d’installer deux personnes face à face produit une géométrie de l’équivalence. Il y a deux micros, donc deux positions. Deux positions, donc deux légitimités. Deux légitimités, donc une controverse.

Or il me semble qu’il y a une différence essentielle entre une controverse scientifique et une dispute médiatique. Une controverse scientifique suppose des méthodes partagées, des données discutables, des arguments évaluables par des pairs, des incertitudes que l’on peut décrire. Une dispute médiatique peut se contenter d’un désaccord expressif. Le premier monde demande du temps, le second demande du rythme. Le premier cherche les nuances, le second préfère les oppositions. Le premier cherche à savoir, alors que le second cherche à produire un “moment”.

(source: Joe Dator, “Facts Don’t Matter”, publié dans The New Yorker, 5 décembre 2016)

C’est tout le problème de ce qu’on appelle, dans la littérature anglo-saxonne, le false balance, ou faux équilibre. Natascha Rietdijk et Alfred Archer le définissent, dans Post-Truth, False Balance and Virtuous Gatekeeping, comme le fait de présenter deux côtés d’un débat comme plus égaux que ne le justifie l’état des preuves. Ils insistent sur le fait que ce mécanisme ne relève pas nécessairement de la fake news, mais qu’il contribue à dévaluer la vérité en brouillant ce qui compte comme preuve et qui peut être reconnu comme autorité compétente. Dans The Epistemic Dangers of Journalistic Balance, Giulia Terzian parle de son côté d’un danger épistémique, le format équilibré pouvant représenter improprement un conflit de points de vue comme une dispute entre égaux épistémiques, et conduire le public à tirer de mauvaises conclusions sur l’état réel des connaissances.

Le problème n’est pas qu’il existe des voix dissidentes. Il y en a toujours, et j’imagine qu’il doit y en avoir. Le problème commence quand la dissidence est mise en scène comme si elle avait le même poids que l’état accumulé des connaissances. Ce n’est pas parce qu’il existe deux phrases contradictoires qu’il existe deux positions également sérieuses. Ce n’est pas parce qu’un polémiste sait répondre vite qu’il répond bien. Ce n’est pas parce qu’une opinion existe dans l’espace public qu’elle mérite d’être traitée comme une hypothèse scientifique robuste.

Le climat offre probablement l’exemple le plus documenté de ce problème. Maxwell Boykoff et Jules Boykoff avaient postulé, dans Balance as Bias: Global Warming and the US Prestige Press, que l’équilibre peut devenir un biais. Leur analyse montrait que, dans la presse américaine sérieuse (“de prestige”), la volonté de donner “les deux côtés” avait conduit à accorder une place disproportionnée aux positions climatosceptiques, contribuant à faire diverger le discours médiatique du discours scientifique. Sur la couverture du climat de 1988 à 2002, une part importante des articles donnait aux climatosceptiques une attention équivalente à celle des défenseurs du consensus scientifique.

Le cas français n’est pas moins instructif. Olivier Godard, dans Le climato-scepticisme médiatique en France : un sophisme moderne, insiste sur le fait que le climatoscepticisme médiatique français n’est pas une controverse scientifique, ni une contre-expertise, mais un sophisme qui emprunte des arguments du débat scientifique en les déformant au service d’une visée idéologique. La description d’Olivier Godard est presque une théorie générale du plateau télé : à s’en tenir aux apparences, on pourrait croire à une “belle” controverse scientifique entre théories opposées et également dignes d’attention. Mais ces apparences sont trompeuses, car beaucoup de ces figures médiatiques ne participent pas, ou très marginalement, au travail ordinaire des communautés scientifiques concernées.

Il est important de distinguer deux choses que le plateau confond presque structurellement, la contradiction et la critique. La contradiction, c’est facile puisqu’il suffit de trouver quelqu’un qui dit non. La critique, elle, est plus exigeante, puisqu’elle suppose de comprendre ce qui est avancé, de savoir où se situent les incertitudes, d’identifier les hypothèses fragiles, les données manquantes, les méthodes discutables. Un bon contradicteur scientifique n’est pas celui qui vient dire l’inverse, c’est celui qui sait où porter le doute. Il y a une différence entre contester un résultat et installer du brouillard.

J’imagine que les journalistes ne font pas cela uniquement par cynisme. Il y a des contraintes de temps, de format, de production. Gaye Tuchman l’avait très bien montré dans Objectivity as Strategic Ritual. L’objectivité journalistique fonctionne aussi comme un rituel stratégique. Comme c’est un métier exposé aux critiques, aux délais, aux risques juridiques et aux pressions hiérarchiques, certaines procédures permettent de revendiquer une posture objective. Citer plusieurs personnes, mettre des guillemets, juxtaposer des points de vue, tout cela peut devenir une manière de se protéger. Le problème est que ces procédures envoient des signaux d’objectivité, sans la produire. Elles prouvent juste que le journaliste a respecté le rituel, elles ne prouvent pas que le public a été mieux informé.

Jay Rosen formule une critique proche avec sa notion de View from Nowhere. Le journaliste fait semblant de se placer entre deux pôles, refuse d’assumer une position, et appelle cela impartialité. Mais Jay Rosen rappelle que l’autorité journalistique ne vient pas du fait de prétendre n’avoir aucun point de vue, elle vient du travail de journaliste (enquêter, vérifier, maîtriser un sujet, connaître les faits, creuser sous la surface). La neutralité de posture devient une facilité : si deux camps me critiquent, c’est que je dois être au milieu, et si je suis au milieu, c’est que je suis impartial, et si je suis impartial, j’ai fait mon travail.

Invariablement, ça me fait penser à la culture scolaire de la dissertation. Dans sa version sérieuse, la dissertation ne consiste pas à dire “d’un côté, de l’autre”. Elle suppose de poser un problème, de construire les termes du désaccord, d’évaluer les arguments, puis de dépasser l’opposition initiale. Mais dans sa version paresseuse, de mauvais élève, elle devient une machine à produire de la symétrie, avec le plan classique, thèse, antithèse, et une synthèse molle qui permet de ne pas trancher. Le journalisme de plateau semble parfois avoir retenu cette version-là. Il ne cherche pas à savoir si les arguments se valent, il cherche à faire tenir le face-à-face.

Et à ce jeu, le polémiste est clairement le client idéal. Il parle vite, il coupe, il formule des phrases courtes, il a toujours une certitude prête à être réchauffée. Il ne va pas s’embarrasser des questions de protocoles, de marges d’erreur, de problèmes de mesure ou de conditions d’identification. En face, le scientifique, lui, arrive avec des scrupules, il distingue, il nuance, il hésite,  il précise que cela dépend de la période, de l’échantillon, de la méthode, du modèle, du niveau de confiance. C’est profondément asymétrique, le polémiste vient jouer au tennis, alors que le scientifique arrive avec sa bibliothèque… Et la plupart des formats récompensent le premier. Un chercheur qui explique patiemment une distribution de probabilités, une incertitude causale ou un consensus scientifique fait rarement “un moment”, pour reprendre la formule de la journaliste Léa Salamé, qui déclarait “mon obsession, ce n’est pas d’aller chercher la vérité, c’est qu’il y ait un moment“. “Un moment”, c’est quand un polémiste lance une formule, quand il accuse, il exagère, il fait monter la tension, et ça produit immédiatement une séquence qui marquera, qui transformera une  question en dramaturgie.

Les naïfs, ou les optimistes, objecteront probablement que le public n’est pas dupe. Peut-être. Mais les travaux empiriques sur le faux équilibre ne sont pas rassurants.  Megan Imundo et David Rapp montrent, dans des expériences sur le climat décrites dans When Fairness is Flawed, que l’exposition à des arguments contraires au consensus réduit la perception du consensus expert, même lorsque ces arguments sont présentés avec une position consensuelle. Ils montrent aussi qu’un rappel explicite du poids des preuves, un weight-of-evidence statement, peut atténuer cet effet. Autrement dit, il ne suffit pas de “donner les deux côtés” et de faire confiance au public. Si l’on ne contextualise pas les positions, si l’on ne dit pas où se trouve le poids des preuves, on risque de fabriquer de l’incertitude là où elle n’a pas lieu d’être.

J’ai l’impression que la seule sortie possible, c’est de prendre l’impartialité au sérieux. Être impartial, ce n’est pas donner le même temps à toutes les affirmations, c’est rendre justice à leur statut. Une hypothèse marginale peut être mentionnée comme marginale, ce qu’elle est vraiment. Une incertitude peut être discutée comme incertitude. Un consensus peut être présenté comme consensus, sans être transformé en dogme. Une controverse scientifique peut être exposée, mais en expliquant qui y participe, sur quelles bases, avec quelles méthodes, et avec quel degré de reconnaissance par les communautés concernées. Ce serait un journalisme moins théâtral, peut-être, mais plus honnête. Au lieu d’un “pour/contre”, on pourrait avoir une cartographie explicite et claire, annonçant ce qu’on sait assez solidement, ce qui reste incertain, ce qui fait débat entre spécialistes, ce qui relève de la polémique publique, et ce qui est simplement faux. Au risque de me répéter, le pluralisme n’exige pas l’égalité artificielle des arguments. Il exige au contraire que l’on donne au public les moyens de comprendre pourquoi certains arguments pèsent plus que d’autres.

Mais on n’y est pas. On ne peut se rendre sur plateau télé (ou radio) que sur un malentendu. Le scientifique croit venir expliquer là où en est la connaissance scientifique, mais bien souvent, le plateau attend qu’il contribue à produire un “moment”. À ce jeu, le polémiste est chez lui alors que le scientifique a clairement l’air d’un invité de passage. Pourquoi continuer à participer à ce cirque médiatique ?

Recoverability of market-wide fair insurance premiums under selection bias

Our article, Recoverability of market-wide fair insurance premiums under selection bias, with Marie-Pier Côté and Olivier Côté, was published in Insurance: Mathematics & Economics.

Fairness adjustments in insurance pricing are defined relative to a reference population, i.e., to a joint distribution of (X, D, Y) where X are rating factors, D protected attributes, and Y is claim amount. Because an insurer’s portfolio is generally a selected subpopulation, portfolio and population reference distributions typically differ, so portfolio-calibrated and population-calibrated fairness adjustments need not coincide. In what follows, we use selection bias as an umbrella term for any discrepancy between an observed sample and its target population. We call portfolio composition bias the insurance-specific form of selection bias induced by the portfolio inclusion mechanism (underwriting/marketing), which makes each insurer’s portfolio a selected subpopulation. Relying on causal inference and a portfolio composition indicator, we characterize how portfolio composition bias affects common premium adjustments (unawareness, discrimination-free pricing, and transport-based corrective pricing), and we provide restrictive conditions under which portfolio and population adjustments coincide. We propose estimators to recover the fairness-adjusted premiums on the regulator-intended target population from selection-biased data, by using externally available information on the population marginal distribution of the prohibited attribute D. We study this scope mismatch from the policyholder’s perspective: we model the market premium faced by a newly entering policyholder (not yet assigned to any portfolio) as a mixture of insurer-specific premiums, weighted by the probability of being assigned to each insurer. Under this view, a pricing rule can satisfy a fairness criterion within each insurer’s portfolio yet produce direct or proxy discrimination in the market when portfolio inclusion depends on X and/or D. Finally, we show that enforcing portfolio-level balance on population-intended fair premiums can reintroduce portfolio composition bias, highlighting a regulatory trade-off between portfolio balancing and market-wide fairness. We focus on recoverability: which population-level fairness targets are identifiable from portfolio data, and what minimal external information is required to recover them.

Perceived Fairness in Networks

Last week, the paper Perceived fairness in networks was published in Network Science.

The usual definitions of algorithmic fairness focus on population-level statistics, such as demographic parity or equal opportunity. However, in many social or economic contexts, fairness is not perceived globally, but locally, through an individual’s peer network and comparisons. We propose a theoretical model of perceived fairness networks, in which each individual’s sense of discrimination depends on the local topology of interactions. We show that even if a decision rule satisfies standard criteria of fairness, perceived discrimination can persist or even increase in the presence of homophily or assortative mixing. We propose a formalism for the concept of fairness perception, linking network structure, local observation, and social perception. Analytical and simulation results highlight how network topology affects the divergence between objective fairness and perceived fairness, with implications for algorithmic governance and applications in finance and collaborative insurance.

Des sondages sans sondé(e)s

Il y a deux jours, je revenais sur une (ancienne) étude de l’Ifop pour Fairgen sur l’intention de vote des enseignants aux élections européennes. La note méthodologique expliquant que l’enquête avait été menée auprès de 8 000 personnes représentatives de la population française adulte, “incluant l’équivalent statistique de 580 enseignants de collège et de lycée”, ces 580 enseignants étant “issus de 116 interviews extrapolées par la technologie DataBoostAI”. Il était expliqué que cette technologie, basée sur l’IA générative, visait à améliorer la précision statistique par “génération d’échantillons synthétiques”. J’avais été surpris par cette pseudo amélioration de la précision statistique, tentant de pousser un peu le raisonnement plus loin : si on peut transformer 100 personnes interrogées en 1000 personnes “équivalentes”, pourquoi s’arrêter à 1000 ? Pourquoi ne pas générer 10000 personnes ? Ou toute la population ? Mais je découvre ce soir qu’il est possible d’aller encore plus loin.

Dans Out of One, Many: Using Language Models to Simulate Human Samples, publié en 2023, l’idée de “silicon sampling” est proposée. Il ne s’agit plus seulement de compléter un sous-échantillon trop petit. Il s’agit de demander à un modèle de langage de répondre à la place des personnes. On fournit à l’IA des profils démographiques, ou des “personas”, puis on lui demande de répondre à un questionnaire comme si elle était une personne réelle. On répète l’opération des centaines ou milliers de fois. À la fin, on obtient une table qui ressemble à une enquête. Mais personne n’a nécessairement été interrogé.

Je n’avais pas vu passer cet article, mais il semble que le débat a commencé aux États-Unis en mars dernier, lorsqu’un article d’Axios a cité des résultats sur la santé maternelle, avant de préciser que ces “opinions” ne venaient pas de personnes interrogées mais d’une simulation. Plusieurs articles récents ont cette controverse en expliquant que les réponses avaient été générées par la méthode silicon sampling, sans participation humaine directe. On comprend l’attrait pour les médias, les sondages (sérieux) coutant relativement chers. Les taux de réponse sont de plus en plus faibles, les enquêtes téléphoniques sont de plus en plus difficiles, les panels en ligne posent des problèmes de qualité et de représentativité. Avoir sous le coude une IA qui répond vite, pour presque rien, en donnant des tableaux propres, ça peut séduire, non ?

Eli McKown-Dawson a publié récemment un article, AI polls are fake polls, soulignant que le problème n’est pas que ces modèles sont (forcément) inutiles, mais il faut que leur statut doit être clair. Ce sont des résultats de modèles, pas des sondages. Un sondage collecte de nouvelles données sur ce que des personnes pensent ou ressentent. Le “silicon sampling“, lui, combine des données d’entraînement, des profils démographiques, des prompts et des hypothèses de modélisation pour produire une prédiction de ce qu’un sondage pourrait dire. Et Eli McKown-Dawson insiste sur le fait que cette distinction est essentielle. Les sondages eux-mêmes sont à traiter avec précaution. Ils reposent sur des pondérations, des corrections de non-réponse, parfois des modèles de vraisemblance de vote ou de post-stratification. Si un échantillon contient trop de diplômés ou trop peu de jeunes, on corrige. Si un groupe est difficile à atteindre, on pondère ou on modélise. Mais il repose sur un socle “empirique”, avec des personnes qui ont été contactées, certaines qui ont répondu, et l’incertitude statistique porte sur ce passage fragile d’un échantillon observé à une population.

Dans un sondage synthétique, le modèle ne corrige pas une enquête, il se substitue à l’enquête. C’est pourquoi la comparaison avec les données synthétiques en statistique publique est intéressante, mais aussi trompeuse. Les instituts statistiques produisent parfois des données synthétiques, notamment pour diffuser des microdonnées sans exposer les individus. Mais l’objectif est alors la confidentialité, pas l’augmentation magique de la taille d’un sondage. Dans l’article récent de Shirley Mathur, Yajuan Si et Jerome Reiter, Fully synthetic data for complex surveys, publié dans Survey Methodology, les auteurs proposent des fichiers entièrement synthétiques pour des enquêtes à plan complexe, mais toute la difficulté consiste précisément à tenir compte des poids, du plan de sondage et de l’estimation correcte des variances.

J’ai l’impression que la littérature académique sur le “silicon sampling” est plus prudente que certains usages médiatiques ou commerciaux qu’on peut lire en ligne. L’article fondateur de Lisa Argyle, Ethan Busby, Nancy Fulda, Joshua Gubler, Christopher Rytting et David Wingate, “Out of One, Many”, introduit l’idée essentielle de “algorithmic fidelity“. Le modèle est conditionné par des descriptions sociodémographiques issues de vrais répondants, notamment de l’American National Election Studies, puis les “silicon subjects” répondent aux mêmes questions que les humains. L’objectif est de tester si les distributions de réponses synthétiques reproduisent certains motifs observés dans les données humaines. J’avoue, l’idée est (intellectuellement) intéressante. Elle dit qu’un modèle de langage peut contenir non pas un biais unique, mais une multiplicité de régularités sociales, activables par le contexte. Le même modèle peut répondre différemment selon qu’on le conditionne comme jeune, âgé, démocrate, républicain, homme, femme, etc. Mais les auteurs formulent aussi des conditions exigeantes, les réponses devant être indistinguables de textes humains, cohérentes avec le contexte donné, naturelles par rapport au prompt, et surtout reproduire des relations entre idées, attitudes, démographie et comportements que l’on observe dans les données humaines.

Ce que je lis, ce n’est donc pas une autorisation générale à remplacer les enquêtes, un chèque en blanc, c’est une proposition de recherche. Dans certains domaines, sous certaines conditions, un modèle peut servir à explorer des hypothèses avant une enquête coûteuse. Et ce n’est pas la même chose que publier une simulation comme si elle résumait la voix du public. L’article Random Silicon Sampling va un cran plus loin. Les auteurs proposent de simuler les opinions d’un sous-groupe à partir de sa distribution démographique globale, sans disposer des profils individuels réels. La première figure du papier illustre le pipeline

On extrait la distribution démographique d’un groupe cible, on génère des répondants synthétiques, on les décrit au modèle, puis on agrège leurs réponses. J’avoue. C’est à la fois fascinant et inquiétant. Sur le vote Biden-Trump de 2020, les distributions simulées semblent être très proches de celles de l’ANES. Mais dès que l’on regarde par sous-groupes ou par thèmes, on commence à voir des soucis apparaître. Le modèle devient trop extrême pour certains groupes partisans. Les auteurs notent par exemple que les démocrates et républicains synthétiques votent presque unanimement pour leur camp, davantage que les répondants humains. Plus intéressant encore, le modèle se met à produire des réponses “inoffensives” (“harmless”) ou socialement attendues sur des sujets sensibles. Sur certaines questions de race, de genre, d’homosexualité, de santé ou d’immigration, les réponses générées semblent moins refléter la diversité des opinions humaines qu’une norme de prudence inscrite dans le modèle. Les auteurs parlent d’un biais vers des réponses “harmless”, qui peut varier selon les groupes simulés. Et c’est un point important ! Les modèles ne sont pas seulement des machines à reproduire ce qui se trouve dans les données d’entraînement. Ils sont aussi des machines alignées, filtrées, modérées, ajustées pour produire certains types de réponses. Cela peut être souhaitable pour éviter des propos nuisibles. Mais si l’on veut mesurer l’opinion publique, ce filtrage devient problématique. Un sondage n’est pas censé demander ce qu’il serait raisonnable, prudent ou acceptable de penser. Il est censé mesurer ce que les gens pensent effectivement, y compris lorsque c’est incohérent, gênant, instable ou contradictoire.

Un autre article récent, Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations, présenté à NAACL 2025, montre que l’on peut spécialiser des modèles pour prédire des distributions de réponses à des enquêtes culturelles globales, notamment le World Values Survey et Pew Global Attitudes. Leur résultat est nuancé. Le fine-tuning améliore les performances, y compris sur certains pays ou certaines questions non vus, mais les auteurs soulignent que même leurs meilleurs modèles restent loin d’être parfaits, surtout sur les questions inédites, et que les modèles testés produisent moins de diversité entre pays que les vraies données humaines. Ils concluent explicitement qu’il faut rester prudent quant à l’usage actuel des LLM pour simuler des distributions de réponses. Et si on veut aller un peu plus loin, dans Large Language Models Assume People are More Rational than they actually are, Ryan Liu, Jiayi Geng, Joshua Peterson, Ilia Sucholutsky et Thomas Griffiths montrent que les grands modèles de langage supposent souvent que les humains sont plus rationnels qu’ils ne le sont réellement (c’était dans le titre, on s’en doutait un peu). Dans des tâches de choix risqués, GPT-4o avec raisonnement explicite est beaucoup plus corrélé au modèle de maximisation de l’espérance qu’aux choix humains observés. Autrement dit, le modèle peut produire un comportement qui nous paraît humain parce qu’il correspond à ce que nous croyons que les humains devraient faire, mais pas nécessairement à ce qu’ils font.

C’est peut-être ce point qu’il faut retenir, si on cherche à envisager les risques de ces pratiques. Un sondage synthétique peut être vraisemblable, et le sera sûrement. Il peut être propre, cohérent. Il peut même, dans certains cas, reproduire correctement des résultats globaux connus. Mais il ne faudra pas s’attendre à de vraies surprises. Nate Silver a commenté le billet de McKown-Dawson, AI polls are fake polls, notant que plus les outils d’inférence deviennent bon marché et puissants, plus la valeur relative des données originales augmente.

Beyond the frequently misleading marketing, what bothers me the most about the AI “poll” hype is that as AI tools make statistical inference cheaper and/or better (note that these are not synonyms) that actually increases the comparative value of collecting original data. You might be able to train a model to make a reasonable estimate of what some hard-to-reach poll respondent would say

Un modèle va lisser les trous d’un échantillon. Il peut aider à formuler une hypothèse sur un groupe difficile à atteindre. Mais si l’opinion de ce groupe se déplace, le modèle ne le saura pas tant que personne ne sera allé écouter ce groupe. C’est ce que rappelait Ambuj Tewari, hier, dans AI is replacing humans in responding to some surveys – but simulated opinions are not the same as public opinion. Les simulations ne sont pas des opinions. Les enquêtes sont des instruments de mesure, pas seulement des outils de prédiction. Une IA peut aider à rédiger des questions plus claires, traduire un questionnaire, analyser des réponses ouvertes, résumer des thèmes, ou assister une enquête hybride. Mais lorsqu’on interroge un système d’IA au lieu de personnes, on ne mesure pas l’opinion publique, on simule l’opinion publique à partir de données passées (collectées on ne sait trop comment), de prompts et d’un modèle propriétaire.

Il y a des usages légitimes pour les données synthétiques. En apprentissage automatique, des méthodes peuvent aider à entraîner des classifieurs sur des classes rares. Ce qui peut être très utile en médecine. En statistique publique, les fichiers synthétiques peuvent protéger la confidentialité. En recherche, les agents simulés peuvent aider à tester un questionnaire ou explorer des hypothèses avant le terrain. Mais il est indispensable de garder la frontière visible. Comme j’essayais de le dire dans mon billet, hier, une donnée synthétique peut être utile, mais ce n’est pas une voix. Dans un sondage politique ou social, l’unité statistique n’est pas seulement une ligne dans un fichier. C’est une personne atteinte par un dispositif d’enquête, avec une probabilité d’inclusion, une réponse observée, une non-réponse possible, un poids, et une contribution à l’incertitude. Une ligne produite par un modèle n’a pas cette histoire. Elle dit quelque chose du modèle, pas forcément de la population.

Lisa P. Argyle, Ethan C. Busby, Nancy Fulda, Joshua R. Gubler, Christopher Rytting et David Wingate, “Out of One, Many: Using Language Models to Simulate Human Samples”, Political Analysis, 2023.

Seungjong Sun, Eungu Lee, Dongyan Nan, Xiangying Zhao, Wonbyung Lee, Bernard J. Jansen et Jang Hyun Kim, “Random Silicon Sampling: Simulating Human Sub-Population Opinion Using a Large Language Model Based on Group-Level Demographic Information”, arXiv, 2024.

Yong Cao, Haijiang Liu, Arnav Arora, Isabelle Augenstein, Paul Röttger et Daniel Hershcovich, “Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations”, NAACL, 2025.

Ryan Liu, Jiayi Geng, Joshua C. Peterson, Ilia Sucholutsky et Thomas L. Griffiths, “Large Language Models Assume People Are More Rational Than We Really Are”, ICLR, 2025.

Shirley Mathur, Yajuan Si et Jerome P. Reiter, “Fully synthetic data for complex surveys”, Survey Methodology, Statistique Canada, 2024.

Eli McKown-Dawson, “AI polls are fake polls”, Silver Bulletin, 2026.

Ambuj Tewari, “AI is replacing humans in responding to some surveys – but simulated opinions are not the same as public opinion”, The Conversation, 2026.

« Pelleter en avant » (sécheresse, cumul et causalité, le cas du RGA en France)

Au Québec, on utilise une jolie expression, « pelleter en avant », ou « pelleter par en avant »,

Fait référence à quelqu’un qui déneige en pelletant la neige en avant de lui, ce qui l’amène à cumuler cette dernière dans son chemin. Il doit donc déplacer une quantité de plus en plus grande de neige au fur et à mesure qu’il progresse. Cela fait en sorte, notamment, qu’un jour ou l’autre, il ne pourra plus pelleter par en avant.

J’y pensais ce matin en lisant l’article de L’Argus de l’assurance consacré aux maisons fissurées par la sécheresse (Maisons fissurées : la sécheresse fragilise la solidarité nationale, les propriétaires pourraient payer l’essentiel d’une facture de plus en plus coûteuse). Si on le regarde de trop prêt, comme bien souvent, le sujet semble très technique (argiles, fissures, fondations, arrêtés de catastrophe naturelle, expertises), mais avec un peu de recul, on voit facilement la dimension politique. Qui paiera demain les fissures qui lézardent des centaines de milliers de maisons françaises ? Les assureurs ? L’État ? Les propriétaires eux-mêmes ? Oui, on reconnait des sujets que j’aborde depuis pas mal de temps sur le blog. Parce que l’article rappelle que l’explosion des sinistres liés au retrait-gonflement des argiles menace aujourd’hui l’équilibre du régime des catastrophes naturelles, construit depuis 1982 autour d’un principe de solidarité nationale.

Pour donner un peu de contexte, cette histoire de “retrait-gonflement des argiles“, ou RGA, est un phénomène bien connu des géotechniciens. En une phrase, en période sèche, certains sols argileux se rétractent , et lorsque l’eau revient, ils gonflent. Ces variations sont lentes, mais peuvent atteindre une amplitude suffisante pour endommager les bâtiments. Géorisques rappelle que la grande majorité des sinistres concerne les maisons individuelles. Et ce risque n’est plus du tout marginal. Le dossier Géorisques indique que, depuis 2016, les sécheresses de grande ampleur se succèdent, avec une charge annuelle moyenne du régime Cat Nat autour d’un milliard d’euros, contre environ 400 millions d’euros sur la période 1989-2015. L’année 2022 aurait atteint 3,5 milliards d’euros de sinistralité sécheresse. L’article de L’Argus ajoute que les modélisations CCR anticipent une hausse du coût annuel moyen de la sécheresse géotechnique de l’ordre de 85% d’ici 2050 sous le seul effet climatique, et de 100% en intégrant l’évolution des biens assurés….

Mais le changement climatique ne frappe pas un parc immobilier neuf, homogène, conçu selon les connaissances actuelles. Il frappe un stock de maisons construites à des époques différentes, souvent avant que le risque RGA ne soit bien intégré dans les pratiques de construction. La Cour des comptes rappelait en 2022 que, sur 19,2 millions de maisons individuelles en France métropolitaine, 10,4 millions se situaient en zone d’exposition moyenne ou forte, et que près de 44% de ces maisons exposées avaient été construites après 1975. À mon avis, ce détail est important. Les années 1970 et 1980 sont aussi celles de l’accession pavillonnaire de masse, des lotissements, de la résidence secondaire démocratisée, de la promesse faite aux classes moyennes : devenir propriétaires, avoir son pavillon, son jardin, parfois son petit appartement au bord de la mer. Les “maisons Merlin” moquées par Coluche (dans le syndicat) peuvent servir d’image de cette époque. Le Monde décrivait en 1982 l’essor de Guy Merlin, promoteur de l’immobilier de loisirs à bas prix, avec 35 000 logements construits et 150 000 personnes logées, dans une logique de diffusion massive de la propriété de vacances. C’est aussi, un peu plus tôt, la période des “Chalandonnettes”, ces maisons individuelles en accession, de type industriel, issues des mesures incitatives portées par Albin Chalandon à la fin des années 1960 et au début des années 1970. Le terme est resté péjoratif : il désigne environ 60 000 à 70 000 pavillons à bas prix, construits dans une logique de standardisation et de promotion privée, dont les déboires ont rapidement nourri une critique de la qualité de conception et de construction (comme le rappelle l’AQC). Il ne s’agit pas de dire que ces programmes expliquent à eux seuls les sinistres actuels. Mais ils donnent du contexte, rappelant quelque chose d’important : le changement climatique ne frappe pas seulement des sols argileux. Il touche en grande partie un stock bâti produit dans une économie de l’accession rapide, du prix contenu et de la vulnérabilité parfois différée. Ce qui n’a pas été payé au moment de la construction — étude de sol, fondations adaptées, gestion fine de l’eau, qualité structurelle — peut revenir, quarante ou cinquante ans plus tard, sous forme de fissures, d’expertises, de contentieux et d’indemnisation CatNat.

Et justement, les documents techniques de la MRN sont clairs, les maisons individuelles sont particulièrement vulnérables parce qu’elles sont souvent légères, peu rigides, fondées superficiellement, et construites sans étude géotechnique préalable permettant d’identifier la présence éventuelle d’argile gonflante. Géorisques décrit même la construction sinistrée typique comme une maison individuelle de plain-pied, reposant sur des fondations inadaptées, avec présence d’arbres à proximité. La Cour des comptes va dans le même sens : en l’absence d’étude de sol, le choix économiquement attractif à court terme peut être celui de fondations non adaptées au sol, moins coûteuses au moment de l’achat mais susceptibles d’entraîner des dommages à plus long terme. Elle note aussi que, dans un marché de la construction fortement concurrentiel, cette option permet d’afficher un prix plus attractif.

Il y a donc une chaîne de valeur complète derrière la fissure, avec un terrain vendu, un permis accordé, une étude de sol parfois absente, un constructeur qui arbitre entre coût et prudence, un promoteur qui vend une promesse d’accession, un acheteur qui regarde surtout le prix, un commune qui urbanise, des règles de prévention qui arrivent tard, puis à la fin, un assureur qui, des années plus tard, reçoit une demande d’indemnisation de sinistre. Comme souvent, l’assureur est le dernier de la chaîne,  celui à qui on présente la facture quand les décisions passées, les défauts de prévention et le changement climatique se rencontrent. Et c’est là que les problèmes commencent…

Dans le régime Cat Nat, il ne suffit pas qu’une maison soit fissurée et qu’une sécheresse ait eu lieu. Encore faut-il que le dommage ait pour “cause déterminante” l’intensité anormale de l’agent naturel, ou, pour le RGA, la succession anormale d’épisodes de sécheresse et de réhydratation. Dans deux rapports publiés par la Chaire PARI (L’assurance des catastrophes naturelles et la cause déterminante des dommages provoqués ou non par la sécheresse/réhydratation des sols), Rodolphe Bigot montre que cette notion de cause déterminante est centrale, mais difficile. Elle n’exige pas que la sécheresse soit la cause exclusive du dommage, seulement qu’elle joue le rôle causal décisif. Or une maison fissurée a rarement une seule cause. Il peut y avoir des argiles, une sécheresse, des fondations insuffisantes, une pente, des arbres, une fuite de canalisation, un drainage mal conçu, une fissure ancienne, un défaut de chaînage. Les guides techniques de l’IFSTTAR rappellent qu’on peut réduire la sensibilité de la maison en agissant à la fois sur l’eau, l’environnement, les arbres, les fondations, le chaînage des murs et l’agencement de la construction. Mais lorsque la maison est déjà construite, parfois depuis quarante ans, ces choix ne sont plus des options simples. Ils sont devenus des coûts de remédiation. Et c’est précisément ce que souligne la Cour des comptes : intégrer les bonnes dispositions dès la construction coûte relativement peu, mais modifier après coup une maison existante (notamment reprendre ses fondations) coûte extrêmement cher. Elle cite des ordres de grandeur allant d’environ 21 000 euros pour certaines injections à 76 000 euros pour des techniques de longrines et micropieux.

On comprend alors pourquoi le RGA est un risque de cumul. Ce n’est pas seulement une succession de sinistres indépendants. C’est un risque où chaque sécheresse peut frapper un bâti déjà vulnérable, parfois déjà fissuré, parfois déjà refusé à l’indemnisation, parfois réparé seulement en surface. La maison garde la trace des épisodes passés. Le dossier d’assurance, lui, essaie de reconstituer cette mémoire avec des expertises, des photographies, des dates, des arrêtés Cat Nat et des arguments de causalité. Dans un incendie, refuser un sinistre peut être une décision de couverture. Le feu est passé. Le dommage est là. Dans le RGA, la fissure reste dans le mur, les fondations restent dans le sol, les argiles continueront à se rétracter et gonfler. Refuser aujourd’hui peut donc parfois signifier : ne pas payer maintenant, mais laisser grossir une facture qui reviendra plus tard. C’est ce que l’on pourrait appeler une perte différée.

Une perte différée n’est pas simplement un sinistre déclaré tardivement. Ce n’est pas seulement un dossier mal provisionné. C’est une perte que l’on croit avoir écartée juridiquement, mais qui continue physiquement d’exister. Le refus d’indemnisation ne l’éteint pas toujours. Il peut la déplacer dans le temps, la rendre plus coûteuse, et surtout plus difficile à attribuer. Plus le temps passe, plus la causalité se brouille, comme le dit Rodolphe Bigot. Les fissures anciennes et nouvelles se mélangent. Les sécheresses successives se superposent. Des travaux partiels (ou cosmétiques) peuvent masquer le problème sans le résoudre. Le propriétaire peut avoir changé. L’assureur aussi. La maison, elle, garde la mémoire des chocs antérieurs. Mais le droit doit répondre à une question binaire : la sécheresse reconnue était-elle, oui ou non, la cause déterminante ? Il ne suffira pas de compter les sinistres payés, il faudra aussi regarder les sinistres refusés, les dossiers rouverts, les contentieux, les maisons déjà expertisées qui reviennent après une nouvelle sécheresse, les réparations insuffisantes, les coûts qui explosent lorsque la reprise en sous-œuvre devient nécessaire. Autrement dit, il faudra suivre le bâti, pas seulement le dossier.

Pour les actuaires, c’est un vrai défi ! Et il faudra s’y atteler parce que les engagements potentiels sont impressionnants. La Cour des comptes reprend les chiffrages de France Assureurs selon lesquels le coût cumulé du risque sécheresse pour les assurances passerait de 13,8 milliards d’euros sur 1999-2019 à 43 milliards d’euros pour les trente années suivantes. Et encore : cette estimation ne tient pas compte de tous les effets possibles de remédiation, ni de la manière dont les nouvelles règles de construction pourraient réduire le risque sur les constructions neuves. Le problème du stock, lui, demeure. Les règles récentes peuvent améliorer les constructions futures, mais elles ne réparent pas les millions de maisons déjà construites. La Cour des comptes l’écrit explicitement : les mesures issues de la loi ÉLAN concernent les constructions nouvellement construites et ne règlent pas le problème des maisons déjà exposées, déjà fragilisées ou potentiellement concernées. Pour ce stock, des mesures de prévention devraient être expérimentées.

En Québecois, je dirais que la stratégie a été de « pelleter en avant » (stratégie classique de gestion des risques en période de contraction budgétaire). Pendant des décennies, on a construit des maisons sur des sols parfois mal connus. On a différé le coût de la prévention. On a laissé la question du sol dans l’angle mort du prix de vente. Puis les sécheresses se sont répétées. Puis les fissures sont apparues. Puis on a discuté de cause déterminante. Puis on a refusé certains dossiers. Puis les maisons sont restées là. À chaque étape, quelqu’un a pu avancer un peu en repoussant le problème, le vendeur du terrain, le promoteur, le constructeur, l’acheteur contraint par son budget, la commune qui cherche à développer son territoire, l’État qui ajuste les critères Cat Nat, l’assureur qui conteste la causalité. À force de « pelleter en avant », la neige s’accumule, devant tout le monde. Elle devient de plus en plus lourde, et à partir une réflexion collective, on a du mal à voir comment régler la facture…

La “cause déterminante” est à mon avis la condition indispensable pour éviter que le régime Cat Nat ne devienne une assurance générale de la construction. Cela veut dire qu’il ne sera pas possible d’indemniser toutes les fissures. Certaines relèvent de défauts constructifs, de travaux mal faits, d’un défaut d’entretien, d’un arbre trop proche, d’une fuite d’eau, ou d’une vulnérabilité qui n’a pas de lien déterminant avec un épisode de sécheresse reconnu. Mais il faudrait regarder les refus avec attention. Certains ne font que déplacer la perte, vers un autre assureur, vers un futur arrêté Cat Nat, vers le propriétaire, vers le contentieux, ou vers le régime dans son ensemble. Pour un risque lent, cumulatif, fortement dépendant du stock bâti, le bon indicateur n’est donc pas seulement le montant payé aujourd’hui. C’est aussi le montant que l’on crée, ou que l’on laisse croître, en ne réparant pas. L’assureur est souvent accusé d’être celui qui ne veut pas payer. Mais dans ce dossier, il est aussi le dernier maillon d’une longue chaîne. Il paie les pots cassés d’un urbanisme, d’une construction, d’une politique de prévention et d’un climat qui ont longtemps avancé séparément. Le RGA rappelle brutalement que l’assurance ne peut pas être le seul lieu où se règle, après coup, le coût des décisions prises avant le sinistre.

Pourquoi ne pas générer toute la population (grâce aux données synthétiques) ?

J’ai découvert un peu par hasard (via un post sur bsk de Thomas Delclite) une étude de l’Ifop pour Fairgen sur l’intention de vote des enseignants aux élections européennes. La note méthodologique indique que l’enquête a été menée auprès de 8 000 personnes représentatives de la population française adulte, “incluant l’équivalent statistique de 580 enseignants de collège et de lycée”, ces 580 enseignants étant “issus de 116 interviews extrapolées par la technologie DataBoostAI”. Le même document précise que cette technologie, basée sur l’IA générative, vise à améliorer la précision statistique par “génération d’échantillons synthétiques”.

Je n’ai jamais été très bon en sondages, mais comprends bien l’enjeu pratique. Dans un sondage national, certains groupes sont trop petits pour être analysés directement. Si l’on interroge 1 000 personnes, il est possible que l’on n’ait que quelques dizaines d’enseignants, quelques dizaines d’agriculteurs, ou quelques dizaines de personnes concernées par une situation particulière. Les résultats par sous-groupe deviennent alors très instables. Le billet récent de Thomas Delclite (publié par Mediapart, sous le titre “Quand 1000 personnes ne suffisent pas”) pose clairement ce problème, en expliquant que la réponse expérimentée consiste, en quelque sorte, à “inventer” des répondants supplémentaires pour mieux décrire de petits groupes. Et il explique rapidement l’idée.

Mais si on peut transformer 116 enseignants interrogés en un “équivalent statistique” de 580 enseignants, pourquoi s’arrêter à 580 ? Pourquoi ne pas en générer 1 000 ? 10 000 ? Ou, tant qu’à faire, pourquoi ne pas générer toute la population des enseignants français ? On appellerait ça un “équivalent statistique” d’un recensement exhaustif. Après tout, une fois le modèle entraîné, le coût marginal d’une ligne synthétique est presque nul. Ok, la question semble stupide, ou naïve, mais je pense qu’elle est importante parce qu’elle va nous obliger à distinguer clairement deux choses très différentes : augmenter le nombre de lignes dans une base, et augmenter l’information statistique contenue dans l’enquête.

Au risque de dire des banalités, comme bien souvent, ces méthodes sont connues depuis longtemps en statistique. On peut utiliser de l’information auxiliaire pour caler un échantillon sur des marges connues, comme dans les estimateurs par calibration de Jean-Claude Deville et Carl-Erik Särndal (dans Calibration Estimators in Survey Sampling). Dans ce cadre, on modifie les poids de sondage pour respecter des contraintes connues sur la population, par exemple des totaux par sexe, âge ou région. On peut aussi, en estimation sur petits domaines, emprunter à d’autres domaines pour produire des estimations lorsque l’échantillon local est trop petit. Dans Small Area Estimation, J.N.K. Rao et Isabel Molina rappellent que les estimateurs directs deviennent insuffisants lorsque les tailles par domaine sont faibles, et que les méthodes indirectes reposent alors sur un modèle reliant les petits domaines entre eux.

Autrement dit, l’idée d’aider un petit sous-échantillon par un modèle n’est pas absurde. En fait, c’est le cœur de toute une partie de la statistique d’enquête. Mais dans cette littérature, le prix à payer est explicite. On ne dit pas simplement “nous avons plus de données”. On dit : nous avons un modèle, nous empruntons de l’information, et l’incertitude finale doit intégrer l’incertitude des données initiales, l’incertitude du modèle, et le risque de biais si le modèle est mal spécifié. C’est ce point qui me semble disparaître derrière l’expression “équivalent statistique”. Si j’étais mesquin, je dirais que ça rejoins ce que j’explique à mes étudiants, quand je commence un cours de statistique mathématique, ou de régression : en nommant les hypothèses, explicitement, on va avoir des garanties théoriques. Mais effectivement, on est loin de la magie des approches computationnelles (même si je les trouve complémentaires).

Faisons quelques simulations pour illustrer ce problème. Supposons qu’on veuille estimer une proportion p. On observe n personnes réelles, puis on entraîne un modèle génératif \widehat P_n sur ces données. À partir de ce modèle, on génère (m) personnes synthétiques. Pour une variable Y, on calcule ensuite une moyenne synthétique\widehat\theta_m^\ast = \frac{1}{m}\sum_{j=1}^m Y_j^\ast.Conditionnellement aux données réellement observées, plus m est grand, plus la moyenne synthétique est stable. Si je génère 10 000 individus synthétiques au lieu de 1 000, je réduis le bruit de simulation. Mais je ne réduis pas magiquement l’incertitude provenant des n personnes réellement interrogées. C’est exactement la décomposition de la variance, le “théorème de Pythagore de la statistique\mathrm{Var}(\widehat\theta_m^\ast)=\mathrm{Var}\left(\mathbb E[\widehat\theta_m^\ast \mid D_n]\right)+\mathbb E\left[\mathrm{Var}(\widehat\theta_m^\ast \mid D_n)\right].Le second terme diminue quand on génère davantage de données synthétiques. Le premier reste. C’est l’incertitude liée à l’échantillon initial, aux quotas, à la non-réponse, aux biais de recrutement, et au modèle appris. Quand m\to\infty, on obtient seulement la réponse moyenne du modèle. On ne découvre pas la vérité de la population.

Une première simulation permet de voir un peu mieux ce problème. Supposons que la vraie proportion soit p=0{,}35. On interroge 100 personnes réelles. On estime la proportion observée, puis on génère 900 personnes synthétiques à partir de cette proportion estimée. On compare trois situations : 100 vraies personnes, 100 vraies personnes plus 900 synthétiques, et 1 000 vraies personnes.

Sur 5 000 répétitions, les écarts-types obtenus sont les suivants :

set.seed(123)
B = 5000
p = 0.35
n = 100
m = 900
sim1 = replicate(B, {
+ y = rbinom(n, size = 1, prob = p)
+ phat = mean(y)
+ y_synth = rbinom(m, size = 1, prob = phat)
+ real_100 = phat
+ synth_1000 = mean(c(y, y_synth))
+ real_1000 = mean(rbinom(n + m, size = 1, prob = p))
+ c(real_100 = real_100,
+ synth_1000 = synth_1000,
+ real_1000 = real_1000)
+ })
sim1 = as.data.frame(t(sim1))
apply(sim1, 2, sd)
real_100 synth_1000 real_1000
0.04824604 0.05018030 0.01484701

soit

Écart-type des estimateurs dans la première simulation
Méthode Écart-type
100 vraies personnes 0,048
100 vraies personnes + 900 synthétiques 0,050
1 000 vraies personnes 0,015

Le résultat est clair. Les 900 personnes synthétiques ne donnent pas la précision de 1 000 vraies personnes. Dans cette simulation, elles se comportent plutôt comme une répétition, bruitée certes, de ce que les 100 premières personnes avaient déjà raconté. Et le problème devient plus grave si l’on calcule ensuite des intervalles de confiance, ou plus précisément la couverture empirique des intervalles de confiance construits naïvement, c’est-à-dire en traitant les 1 000 lignes comme 1 000 observations indépendantes.

se_wrong = sqrt(sim1$synth_1000 * (1 - sim1$synth_1000) / (n + m))
se_real100 = sqrt(sim1$real_100 * (1 - sim1$real_100) / n)
se_real1000 = sqrt(sim1$real_1000 * (1 - sim1$real_1000) / (n + m))
coverage = c(
+ synthetic_treated_as_1000 =
+ mean(abs(sim1$synth_1000 - p) <= 1.96 * se_wrong),
+ real_100 =
+ mean(abs(sim1$real_100 - p) <= 1.96 * se_real100),
+ real_1000 =
+ mean(abs(sim1$real_1000 - p) <= 1.96 * se_real1000)
+ )
coverage
synthetic_treated_as_1000 real_100 real_1000
0.4478 0.9386 0.9506

Dans la simulation, l’intervalle naïf construit en traitant les 100 réels plus 900 synthétiques comme 1 000 vraies observations ne couvre la vraie valeur que dans 44,8% des cas, au lieu des 95% attendus. Avec 100 vraies personnes, l’intervalle usuel couvre environ 93,9% des cas. Avec 1 000 vraies personnes, il couvre environ 95,1% des cas.

Couverture empirique des intervalles de confiance à 95 %
Méthode Couverture observée
Échantillon synthétique traité comme 1 000 observations indépendantes 44,8 %
100 vraies personnes 93,9 %
1 000 vraies personnes 95,1 %

L’erreur vient du fait que l’on confond le nombre de lignes avec la taille effective d’échantillon.

Allez, une deuxième simulation pour mettre en avant un risque encore plus problématique, voire politique. Imaginons une population composée de deux groupes U=0 et U=1, en proportions égales. Dans le premier groupe, la probabilité de répondre oui vaut 0,25. Dans le second, elle vaut 0,70. La vraie proportion globale est donc0{,}5 \times 0{,}25 + 0{,}5 \times 0{,}70 = 0{,}475.Mais supposons que l’échantillon réel soit biaisé : au lieu d’avoir 50% de personnes du groupe U=1, il en contient 75%. On génère ensuite 900 personnes synthétiques à partir de ce que raconte cet échantillon biaisé.

set.seed(123)
B = 5000
n = 100
m = 900
sim2 = replicate(B, {
+ U = rbinom(n, size = 1, prob = 0.75)
+ y = rbinom(n, size = 1, prob = ifelse(U == 1, 0.70, 0.25))
+ phat = mean(y)
+ y_synth = rbinom(m, size = 1, prob = phat)
+ est_synth = mean(c(y, y_synth))
+ se_wrong = sqrt(est_synth * (1 - est_synth) / (n + m))
+ c(est = est_synth,
+ low = est_synth - 1.96 * se_wrong,
+ high = est_synth + 1.96 * se_wrong)
+ })
sim2 = as.data.frame(t(sim2))
mean(sim2$est)
[1] 0.5861708
p_true
[1] 0.475

Le résultat moyen de l’estimation synthétique est 0,586, alors que la vraie valeur est 0,475. Le biais est important (il me semble). Et si on construit un intervalle de confiance naïf comme si l’on avait 1 000 observations indépendantes, il ne contient la vraie valeur que dans 5,6% des cas.

mean(sim2$low <= p_true & sim2$high >= p_true)
[1] 0.0556

J’ai l’impression que ce biais dans les données pose soucis, si on n’en tient pas compte. Si on connait ce biais de réponse, on peut bien entendu en tenir compte dans la simulation, mais si on a peu de données, pourra-t-on l’estimer correctement ? La génération synthétique peut prolonger le biais, le lisser, le rendre plus cohérent, et surtout créer une fausse illusion. On passe alors d’une incertitude visible, “nous n’avons que 100 observations”, à une précision apparente, “nous avons 1 000 lignes”… mais autour d’une mauvaise valeur.

Ok, je force un peu le trait ici, les promoteurs de ces méthodes ne disent pas toujours qu’il suffit naïvement de dupliquer les observations. Dans Synthetic data in marketing studies de Samuel Cohen et Thomas Duhard, la méthode est présentée comme un “boost” synthétique évalué par tests parallèles. L’idée est de comparer les données synthétiques à de vrais boosts des données initiales, mis de côté comme référence, et de mesurer une taille d’échantillon effective, ou ESS. Le document indique par exemple que, sur certains jeux de données Pew, Fairgen obtient des facteurs de boost moyens autour de 2,5 à 3,5 selon les tailles de segments, et donne un exemple où un ESS moyen de 2,79 est interprété comme équivalent à passer de 1 000 à 2 790 répondants. Et on sera d’accord, c’est beaucoup plus raisonnable que de dire “nous générons des individus, donc nous avons autant d’information”. Mais cela ne supprime pas le problème. Une taille d’échantillon effective est toujours relative à un protocole de validation, à une classe de questions, à un type de population, à une métrique d’erreur, et à l’hypothèse que le futur ressemble suffisamment aux benchmarks passés. Ce n’est pas un droit général à multiplier les observations. Le papier lui-même reconnaît que les tests classiques ne s’appliquent pas naturellement aux données synthétiques et qu’il faut les utiliser avec prudence. Il mentionne aussi des risques de mauvaise interprétation, d’intégration difficile dans les méthodes existantes et de transparence.

Et comme bien souvent, la littérature sur les données synthétiques insiste sur ce point depuis longtemps. Donald Rubin proposait dès 1993 des bases de microdonnées synthétiques à des fins de confidentialité (dans Statistical disclosure limitation). Mais l’idée n’était pas de prétendre que les données synthétiques étaient des observations supplémentaires miraculeuses. Il s’agissait de produire des fichiers exploitables tout en protégeant les individus, avec des règles d’inférence adaptées. Il y a vingt ans, dans The Multiple Adaptations of Multiple Imputation, Jerome Reiter et Trivellore Raghunathan rappellaient que les règles usuelles de combinaison des variances ne fonctionnent pas toujours lorsqu’on change de contexte d’imputation, et que des règles spécifiques sont nécessaires pour les données synthétiques. Ils notent aussi que, dans les contextes de données synthétiques, plusieurs jeux synthétiques doivent être générés pour permettre d’estimer correctement les variances, mais que les règles classiques de Rubin peuvent produire des estimations de variance fortement biaisées.

Ce n’est pas une querelle entre anciens statisticiens attachés aux preuves mathématiques, et nouvelles méthodes d’IA. Le cœur du problème est un problème très classique d’inférence. Qu’est-ce qui est aléatoire ? Qu’est-ce qui est observé ? Qu’est-ce qui est imputé ? Quel est le modèle ? Quelle incertitude est propagée ? Et que signifie exactement l’intervalle annoncé ?

Je peux tenter une troisième simulation pour essayer de nuancer la critique. Supposons qu’on cherche à estimer une moyenne dans un petit groupe G=1, qui ne représente que 10% de la population. On observe 1 000 personnes au total, donc seulement une centaine dans ce petit groupe. Une estimation directe sera bruitée. Si une covariable X explique bien la réponse Y, on peut ajuster un modèle sur tout l’échantillon et l’utiliser pour améliorer l’estimation dans le petit groupe. C’est l’idée classique de l’emprunt d’information. Quand le modèle est correct, la simulation donne ceci :

set.seed(123)
logit = function(x) 1 / (1 + exp(-x))
one_run = function(delta = 0, N = 50000, n = 1000) {
+ G = rbinom(N, size = 1, prob = 0.10)
+ X = rnorm(N, mean = 0.5 * G, sd = 1)
+ prob = logit(-1 + 0.8 * X + delta * G)
+ Y = rbinom(N, size = 1, prob = prob)
+ pop = data.frame(G = G, X = X, Y = Y)
+ target = mean(pop$Y[pop$G == 1])
+ s = pop[sample(seq_len(N), n), ]
+ direct = mean(s$Y[s$G == 1])
+ fit = glm(Y ~ X, data = s, family = binomial())
+ pred = predict(fit, newdata = pop[pop$G == 1, ], type = "response")
+ model_based = mean(pred)
+ c(target = target,
+ direct = direct,
+ model_based = model_based)
+ }
B = 1000
res_delta0 = as.data.frame(t(replicate(B, one_run(delta = 0))))
res_delta1 = as.data.frame(t(replicate(B, one_run(delta = 1))))
rmse = function(est, target) sqrt(mean((est - target)^2, na.rm = TRUE))
bias = function(est, target) mean(est - target, na.rm = TRUE)
out = data.frame(
+ scenario = c("model correct", "model correct",
+ "group specificity omitted", "group specificity omitted"),
+ estimator = c("direct", "model_based", "direct", "model_based"),
+ bias = c(
+ bias(res_delta0$direct, res_delta0$target),
+ bias(res_delta0$model_based, res_delta0$target),
+ bias(res_delta1$direct, res_delta1$target),
+ bias(res_delta1$model_based, res_delta1$target)
+ ),
+ rmse = c(
+ rmse(res_delta0$direct, res_delta0$target),
+ rmse(res_delta0$model_based, res_delta0$target),
+ rmse(res_delta1$direct, res_delta1$target),
+ rmse(res_delta1$model_based, res_delta1$target)
+ )
+ )
out
scenario estimator                            bias rmse
1 model correct direct                 -0.0023819498 0.04751389
2 model correct model_based            -0.0005472075 0.01752725
3 group specificity omitted direct      0.0001381138 0.04780230
4 group specificity omitted model_based -0.1907977431 0.19160979

i.e.

Effet d’un échantillon initial biaisé
Quantité Valeur
Vraie proportion dans la population 0,475
Estimation moyenne après génération synthétique 0,586
Couverture de l’intervalle naïf à 95 % 5,6 %

Le modèle aide beaucoup. Il réduit l’erreur quadratique moyenne. Il y a donc des cas où l’on gagne vraiment à emprunter de l’information. Mais si le petit groupe a une spécificité propre, ignorée par le modèle, le résultat se retourne

Comparaison entre estimation directe et estimation assistée par modèle
Scénario Estimateur Biais RMSE
Modèle correct Direct −0,0024 0,0475
Modèle correct Modèle −0,0005 0,0175
Spécificité de groupe omise Direct 0,0001 0,0478
Spécificité de groupe omise Modèle −0,1908 0,1916

Dans ce cas, l’estimateur direct est bruité mais à peu près centré. L’estimateur fondé sur le modèle est beaucoup plus stable, mais il est faux. Il tire le petit groupe vers la structure moyenne apprise ailleurs. C’est exactement ce qu’on redoute dans un sondage d’opinion : le modèle peut “corriger” ce qui ressemble à une anomalie statistique, alors que cette anomalie est peut-être précisément le signal politique ou sociologique que l’on cherchait à mesurer.

Le papier Synthetic data in marketing studies sur Fairgen et Ifop reconnait d’ailleurs cette logique lorsqu’il explique que, dans l’exemple des enseignants, les résultats synthétiques ont été comparés aux résultats bruts du sous-groupe et que les incohérences observées dans les résultats bruts auraient été corrigées par les résultats augmentés par IA. C’est à la fois l’intérêt et le danger de la méthode. Oui, un petit échantillon produit des irrégularités. Mais toute irrégularité n’est pas une erreur. Il faut savoir si l’on veut lisser un bruit d’échantillonnage ou effacer une différence réelle.

L’expression “équivalent statistique” devrait donc être maniée avec beaucoup de prudence. Elle peut avoir un sens technique si elle renvoie à une taille effective validée, sur un protocole documenté, pour une classe précise d’estimations. Mais elle devient trompeuse si elle est comprise comme “nous avons interrogé l’équivalent de 580 personnes”. Une personne synthétique ne répond pas. Elle est générée. Elle ne fournit pas une nouvelle information indépendante sur la population. Elle rend matériel une hypothèse du modèle.

C’est pourquoi ma question “pourquoi ne pas générer toute la population ?” n’était pas une boutade, puisqu’elle met en avant la limite logique de l’argument. Si les données synthétiques apportaient vraiment de l’information indépendante, il faudrait pousser le raisonnement jusqu’au bout : interrogeons 5 personnes, générons 67 millions de Français, calculons les résultats avec une marge d’erreur microscopique, et supprimons les sondages… Personne ne croit sérieusement cela. Ce que l’on génère, ce n’est pas la population, c’est une image de la population selon un modèle, appris à partir de données limitées.

Les données synthétiques peuvent être utiles. Elles peuvent aider à protéger la confidentialité, comme dans les travaux de Little, Rubin, Reiter et Raghunathan. Elles peuvent servir à l’imputation de valeurs manquantes, à la diffusion de microdonnées, à la simulation, ou à l’estimation de petits domaines. Elles peuvent aussi, sous conditions, améliorer des estimations instables. Mais elles demandent une discipline méthodologique stricte : distinguer le réel du synthétique, publier les effectifs réellement observés, décrire le modèle, mesurer la taille effective, propager l’incertitude de génération, tester la robustesse aux biais de sélection, et surtout ne pas présenter une prédiction comme une observation.

Je pense qu’il y a un vrai danger ici, parce que dans un sondage d’opinion, cette distinction subtile n’est pas seulement technique. Elle devient rapidement démocratique. Un sondage n’est pas qu’une machine à produire des pourcentages, c’est un dispositif (souvent fragile) par lequel des voix individuelles sont transformées en représentation collective. On l’a vu, compléter des voix manquantes par des voix synthétiques peut parfois stabiliser artificiellement un tableau, mais ça peut être très facilement orienté…

[à suivre dans des sondages sans sondé(e)s … ]

Jean-Claude Deville et Carl-Erik Särndal, “Calibration Estimators in Survey Sampling”, Journal of the American Statistical Association, 1992.

Roderick J. A. Little, “Statistical Analysis of Masked Data”, Journal of Official Statistics, 1993.

Donald B. Rubin, “Discussion: Statistical Disclosure Limitation”, Journal of Official Statistics, 1993.

Trivellore E. Raghunathan, Jerome P. Reiter et Donald B. Rubin, “Multiple Imputation for Statistical Disclosure Limitation”, Journal of Official Statistics, 2003.

Jerome P. Reiter et Trivellore E. Raghunathan, “The Multiple Adaptations of Multiple Imputation”, Journal of the American Statistical Association, 2007.

J. N. K. Rao et Isabel Molina, Small Area Estimation, 2e édition, Wiley, 2015.

Samuel Cohen et Thomas Duhard, “Synthetic Data in Marketing Studies: Exploring the Promise of Generative AI and Synthetic Data”, ESOMAR Congress, 2024.

Ifop pour Fairgen, L’intention de vote des enseignants aux élections européennes, juin 2024.

Thomas Delclite, “Quand 1000 personnes ne suffisent pas”, Mediapart, 26 mai 2026.

Risques climatiques : la donnée et l’intelligence artificielle ne remplaceront pas la solidarité

Notre tribune, Risques climatiques : la donnée et l’intelligence artificielle ne remplaceront pas la solidarité, écrite avec Laurence Barry, a été publiée par L’Argus de l’Assurance.

À mesure que les risques climatiques s’intensifient, l’essor des données fines et de l’intelligence artificielle promet une meilleure connaissance des expositions. Mais derrière cette avancée technique se joue un choix fondamental : préserver la logique de solidarité qui fonde l’assurance ou glisser vers une individualisation accrue des risques, au risque d’exclure les plus vulnérables ?

EGU’26, When Climate Hazard Granularity Challenges Risk Pooling: A Spatial Perspective

Tomorrow, Raphaël Dalbarade will attend the European Geosciences Union (EGU) Annual Meeting, in Vienna, to present “When Climate Hazard Granularity Challenges Risk Pooling: A Spatial Perspective“, a joint work with Laurence Barry, Caroline Hillairet, Hamza El Hassani, Azeddine Bamansor, Quentin Hénaff, and Simon Blaquière. More very soon…

The French “CatNat” regime provides mandatory natural disaster coverage based on national solidarity, using a uniform rate for all homeowners. However, the increasing availability of high-resolution geoscience data challenges this uniformity. This is notably the case for Clay Shrink-Swell (CSS) risk, which has become a primary cost driver in the last years. Does the shift from national pooling to granular risk segmentation threaten the viability of such solidarity regimes?

To answer this question, we combine empirical analysis with theoretical modeling. First, utilizing a large-scale collection of insurance quotes, we identify a fragmented market where insurers leveraging granular hazard maps coexist with traditional “pooling” actors. Second, to capture the long-term dynamics of this fragmentation, we develop a game-theoretic model of market equilibrium. This model allows us to explicitly simulate how risk selection strategies impact affordability and access to coverage. Our findings suggest that while granular segmentation improves pricing accuracy, it risks creating “insurance deserts” for vulnerable areas. Finally, this technical evolution undermines the regime’s solidarity principle, potentially reducing the socio-economic resilience of communities facing increasing climate geohazards.

Insurance, Biases, Discrimination and Fairness

Two years ago, my book “Insurance, Biases, Discrimination and Fairness” was published in the Springer Actuarial series.

Discrimination in insurance is a difficult topic because, in a very specific sense, insurers are expected to discriminate: they classify risks, build risk pools, and differentiate premiums. This is the logic of risk-based pricing and actuarial fairness. But insurance is not only about pricing risks accurately (accuracy is overrated). It is also about mutualization, risk sharing, and solidarity. The real question is therefore not simply whether insurers should differentiate, but which differences should matter, which should not, where the limits should be drawn, and how to navigate a complex world in which several notions and metrics of fairness coexist, sometimes in tension with one another.

In the book, I tried to connect actuarial pricing, statistical discrimination, legal constraints, algorithmic fairness, explainability, mitigation techniques, and the limits of “fairness through unawareness”. I also discuss a dimension that is often overlooked: causality. Correlation may be useful for prediction, but prevention, explanation, and fairness often require asking what mechanism lies behind an observed association.

For those interested in the mathematics, I have also made lecture notes freely available.

Couvrir les risques de catastrophes naturelles au Japon

Un rapport présentant l’assurance des catastrophes naturelles au Japon est en ligne dans la collection des documents de la Chaire PARI,

Cette note montre que le Japon a construit, face à une exposition exceptionnelle aux séismes, tsunamis, volcans, inondations et glissements de terrain, un système de couverture des catastrophes naturelles original, qui ne repose ni sur un régime unifié de type français ni sur le seul marché privé. Après avoir rappelé la géographie physique et administrative du pays, puis les spécificités du marché immobilier japonais (abondance relative du parc, forte dualité entre propriété et location, faible valorisation du bâti ancien, importance des logements vacants), elle explique que l’assurance habitation japonaise est structurée autour d’un socle de fire insurance couvrant les périls ordinaires et climatiques, auquel s’ajoute un régime spécifique d’assurance séisme, facultatif mais adossé au contrat incendie, partiellement indemnitaire et massivement réassuré par l’État. L’étude montre ensuite, risque par risque, que le séisme constitue le cœur du modèle japonais, avec un partenariat public-privé très institutionnalisé, tandis que l’inondation relève surtout du marché privé complété par des aides publiques ex post ; le tsunami et le volcan, eux, sont couverts juridiquement par le régime séisme mais gérés administrativement par des dispositifs autonomes de surveillance, d’alerte, d’évacuation et de cartographie. Au total, cette note défend l’idée que la “couverture” japonaise ne se réduit jamais à l’assurance : elle combine indemnisation privée, réassurance publique, réserves prudentielles, soutien budgétaire, hazard maps et gouvernance territoriale, dans le but moins de compenser intégralement les pertes que de stabiliser rapidement les conditions de vie et d’organiser la reconstruction après catastrophe.

"sendo l'intento mio scrivere cosa utile a chi la intende…"