Tous les malouins le savent, Jacques Cartier est parti de Saint Malo pour découvrir le Canada en 1536 (si l’on considère son second voyage, c’est à dire celui où il a vraiment pénétré le royaume de Kanata en voguant sur le Saint Laurent). Il y a d’ailleurs un musée du Québec dans les remparts. Et comme s’en vente le musée, les québécois viennent de Saint-Malo.

Or, pour ceux qui ne connaissent pas Saint-Malo, c’est à deux pas du Mont Saint Michel, et du Couesnon qui sépare la Bretagne et la Normandie. Étant né en Normandie, avant de venir vivre à Rennes, j’étais convaincu que j’avais des racines communes avec les Québécois*. Mais j’ai été surpris en voyant les noms de famille des copines de classe de ma fille: les noms ne m’étaient pas du tout familiers… Pourtant, si nous avons des racines communes, il ne serait pas surprenant que les noms de familles se retrouvent (c’est le principe de base de la généalogie, si j’ai bien tout suivi). Aussi j’ai voulu creuser davantage….
- Que disent les experts en généalogie ?





On peut trouver des éléments de réponse ici ou là. Parmi les 3800 Français qui ont immigré (ou émigrer, ça dépend du point de vue) entre 1608 et 1700 :


Entre 1700 et 1765, près de 5000 autres hommes, femmes et enfants originaires de France viennent s’établir au Canada, mais “très peu proviennent de la Bretagne et des régions baignées par la mer“. Ce sont d’ailleurs les ordres de grandeur que j’ai pu avoir dans l’ouvrage de Michel Lambert (qui n’est pas un livre de généalogie à proprement parler mais qui est incroyablement intéressant, même s’il ne donne pas de source – ou de détails sur le sens – pour ces chiffres),
- Normandie, 22.6%
- Aunis, 16.4%
- Perche, 11.4%
- Ile de France (région parisienne) 10.5%
- Poitou, 7.5%
- Maine, 5.2%
- Saintonge 5.2%
- Bretagne 3.5%
Moralité, même si Jacques Cartier est parti de Bretagne, rares semblent être les bretons qui ont émigrés au Québec.
- Calculs de probabilités conditionnelles à partir des noms de famille
Il existe des sites qui donnent les “classements” des noms de familles, au Québec par exemple (ici, avec les 1000 noms les plus portés, avec les proportions respectives), ou dans les régions françaises (là, où j’ai pris à chaque fois les 2000 noms les plus portés avec les proportions respectives, en changeant de région). Les données peuvent être récupérées avec le code suivant
quebec=read.table("http://freakonometrics.free.fr/nom-quebec2.txt", header=TRUE,dec=",") bretagne=read.table("http://freakonometrics.free.fr/nom-bretagne.txt", header=TRUE,dec=",",sep="\t") poitou=read.table("http://freakonometrics.free.fr/nom-poitou.txt", header=TRUE,dec=",",sep="\t") normandie=read.table("http://freakonometrics.free.fr/nom-basse-normandie.txt", header=TRUE,dec=",",sep="\t") aquitaine=read.table("http://freakonometrics.free.fr/nom-aquitaine.txt", header=TRUE,dec=",",sep="\t") alsace=read.table("http://freakonometrics.free.fr/nom-alsace.txt", header=TRUE,dec=",",sep="\t") loire=read.table("http://freakonometrics.free.fr/nom-loire.txt", header=TRUE,dec=",",sep="\t")
J’ai retenu 6 régions françaises, et j’ai calculé la proportions de québécois dont le nom de famille était dans le top 2000 d’une région donnée, i.e.
> head(quebec) Rang Nomdefamille Pourcentage 1 1 Tremblay 1.076 2 2 Gagnon 0.790 3 3 Roy 0.753 4 4 Cote 0.692 5 5 Bouchard 0.530 6 6 Gauthier 0.522 > minquebec=tolower(quebec$Nomdefamille) > rangquebec=quebec$Rang > pctquebec=quebec$Pourcentage/sum(quebec$Pourcentage) > head(bretagne) Rang Patronyme Naissances 1 1 LE GALL 18126 2 2 LE GOFF 16093 3 3 LE ROUX 15905 4 4 THOMAS 15705 5 5 MARTIN 12094 6 6 TANGUY 12045 > minbretagne=tolower(bretagne$Patronyme) > rangbretagne=bretagne$Rang > pctbretagne=bretagne$Naissances/sum(bretagne$Naissances) > I=minquebec%in%minbretagne > sum(pctquebec[I])/sum(pctquebec) [1] 0.2579641
| Région | Proportion |
| Bretagne | 23,39% |
| Normandie | 31,07% |
| Loire | 32,83% |
| Aquitaine | 27,65% |
| Poitou | 32,50% |
| Alsace | 9,71% |
Si on retrouve peu de noms alsacien au Québec, on peut être un peu “surpris” que les régions qui ressortent le plus sont la Loire et le Poitou et pas la Bretagne et la Normandie…. Bon, j’en conviens, je travaille sur les noms de familles bruts, c’est à dire que je ne tiens pas compte du fait que certains noms se sont déformés. Il s’agit de la version simple… on peut bien entendu aller plus loin, par exemple en utilisant des modèles de mélange par exemple… à suivre donc…

*en fait, mes origines sont davantage bourguignonnes, de part mes quatre grands parents, comme le savent tous ceux qui m’ont déjà payé un verre de vin… mais ayant passé toute mon enfance en Normandie, je peux me considérer un peu comme normand. Et adorant la galette saucisse, je suis définitivement breton….
My son would be extremely proud if I tell him I can spend hours building robots. Well, my robots are not as fancy as Dr Tenma’s, but they usually do what I ask them to do. For instance, it is extremely simple to build a robot with R, to extract data from websites. I have mentioned it 

I am not a big fan of those ceremonies, where some actors pretend that they are extremely happy to be there, and then some win a trophy, some don’t, and those who win start to cry, and those who did not get a trophy try to pretend that they are not affected, etc. The other reason is that, since I have several kids, I do not go to see the movies that often (I mean apart from Shrek, Toy Story… Harry Potter is probably the only movie I’ve seen with real actors – or at least human actors).











is the density of a Beta distribution, i.e.

I the talk, I will also mention the transformed Kernel estimate, as introduced in the book on L1 density estimation by Luc Devroye and Laszlo Györfi (the book can be downloaded 
In the book, this is introduced as follows,















Then we explain that with such a price, ruin probability is certain (with an infinite time horizon), so we need to add a safety margin, and a standard idea (but that can be criticized since the expected value has – usually – nothing to do with the variability) is to add a loading proportional to the pure premium. Then the premium is
For small risks, like motor insurance, the loading is not huge. Actually, if risks have finite variance, it can be obtained simply using the central limit theorem (but I’ll get back on that point in a couple of weeks). Here, we see that loading
can be large (up to 400% in 2009).




I recently received an email about forecasting and rules of thumb. “









The Geneva Association just published on its website an interesting report on variable annuities and systemic risk (online 











, en notant que



La rumeur avait agité pas mal de monde en août dernier lors du congrès international de mathématiques, à Hyderabad (même si à l’époque, ce sont surtout les médailles Fields qui avaient retenu toute l’attention, en France en tous les cas), mais finalement le communiqué de l’Union Internationale de Mathématiques (IMU) est finalement tombé hier soir: à compter du 1er juillet, π sera officiellement égal à 4.

(pour les utilisateurs de R, la version 2.12.3. sera lancée exceptionnellement plus tôt afin d’intégrer cette mise à jour – et je crois que MSExcel a prévu un addins qui sera bientôt en ligne, comme pour le passage à l’an 2000).




, et on cherchait à tester une hypothèse de la forme





, on va utiliser un test sur une loi multinomiale, avec


.

le nombre de points tombés dans un ensemble
(ou
désigne la région globale). Si on suppose qu’un nombre aléatoire
de points sont lancés aléatoirement dans
, alors 
(de même taille, éventuellement – afin de garder toutes les observations – formant une partition de 



Plusieurs fois, j’ai lu des commentaires sur le blog (ou sur le premier, à Rennes 1) commençant par quelque chose du genre “j’ai bien aimé même si j’ai pas tout compris“…

est dénombrable, en construisant une bijection entre
et
, comme l’avait Cantor (et que l’infini, c’est quand même super grand).
En cours, nous avons poursuivi sur la loi multinomiale, et le test du chi-deux. Je voulais mettre un petit billet pour récapituler les différents points, et montrer une application numérique (nous reviendrons en détails mercredi sur des applications des outils vus jusqu’à présent).
peut prendre
modalités, notées
, avec
. On posera
appartient au simplexe de
au sens où



). Mais plus généralement, on finira les calculs permettant d’établir que, pour 

).

avec
et pour
.
est
.
est une matrice de projection si elle est idempotente, i.e.
. Ses valeurs propres sont alors 0 ou 1, et si
est le nombre de fois où 1 est valeur propre, et si
, alors
.
. Alors

(qui est aussi le nombre de fois où 1 est valeur propre). Donc


de dimension
. Posons
, pour
le rang de
, en supposant que les 
pour
sont des variables indépendantes.
pouvant prendre toutes les deux deux modalités (disons deux lois binomiales). On est alors face a une loi multinomiale à 4 modalités
avec probabilité 
avec probabilité 
avec probabilité 
avec probabilité 




et
. tels que
et
. On a alors
contraintes sur les paramètres. Ces deux contraintes additionnelles font que la statistique de test s’écrit
i.e.
d’après le théorème de Cochrane.