Pour plus d’informations
Taille du vocabulaire, nombre de mots connus, vocabulaire moyen d’un francophone : tout ce qu’il faut savoir sur ce test de vocabulaire français (test de lexique ou de richesse du vocabulaire), sur ce qu’il mesure et sur la manière d’interpréter votre résultat.
Ce test (https://vocabulaire.lexique.org) estime le nombre de mots connus en français, c’est-à-dire les mots dont nous savons que nous les avons déjà rencontrés (mais dont nous ne connaissons pas forcément le sens). L’ensemble de ces mots forme le lexique mental.
C’est donc un moyen simple d’évaluer son vocabulaire et de connaître la taille de son vocabulaire en quelques minutes.
Il existe plusieurs dizaines de milliers de mots en français, et il n’est évidemment pas possible de tous les tester. Le test utilise donc un échantillon de mots et, à partir de vos réponses, estime combien de mots vous connaissez au total.
C’est pourquoi le résultat est une estimation, et non un comptage exact.
Votre résultat est une estimation. Comme tout test basé sur un échantillon de mots, il comporte une marge d’incertitude. Il ne s’agit donc pas d’un nombre exact de mots que vous avez en mémoire.
Pour autant, si vous faites le test plusieurs fois, vous devriez assez rapidement (au bout de la 3e ou de la 4e fois) atteindre un plateau relativement stable, qui correspond au nombre de mots que vous connaissez.
Nous tirons un certain nombre de mots au hasard parmi les 61 000 lemmes1 de Lexique. Les lemmes proposés proviennent d’un corpus de français de sous-titres de 316 millions de mots.
À partir de ces mots, nous calculons le pourcentage de mots connus, auquel nous soustrayons le pourcentage de fausses détections (mots inventés que vous avez cochés). Nous obtenons ainsi le pourcentage de mots connus corrigé, et nous appliquons ce pourcentage aux 61 000 lemmes pour obtenir le nombre de mots connus.
Les formes fléchies — par exemple mange, mangeons, mangeaient, mangera ou mangées — peuvent généralement être produites à partir du lemme (manger) en appliquant des règles grammaticales. Elles ne sont donc pas nécessairement stockées dans le lexique mental.
Dans notre estimation, connaître un lemme revient donc à connaître aussi ses formes fléchies.
Dans le corpus de sous-titres de films et séries utilisé pour construire notre test, qui contient 316 millions de mots, on trouve environ 61 000 lemmes différents. Les lemmes regroupent notamment les différentes formes d’un même mot : manger, mange, mangeons et mangeraient appartiennent ainsi au même lemme.
Des dictionnaires comme Le Robert peuvent contenir davantage d’entrées, autour de 80 000, mais celles-ci ne sont pas toutes nécessairement encore utilisées dans le français courant.
Un corpus de langue en usage permet donc d’avoir une estimation plus proche du vocabulaire effectivement rencontré par les locuteurs.
En français, la moyenne semble se situer autour de 38 000 lemmes. En anglais, elle est de l’ordre de 40 000 mots (Brysbaert, Stevens, Mandera et Keuleers, 2016).
Ces deux valeurs ne sont toutefois pas complètement comparables : l’estimation dépend de la manière dont les mots inventés (pseudomots) sont utilisés pour corriger les réponses, et cette méthode diffère d’un test à l’autre. Le chiffre pour le français doit en outre être considéré comme provisoire : si le test est largement diffusé et que davantage de personnes y participent, l’estimation pourra être affinée et éventuellement évoluer.
La taille du vocabulaire varie naturellement d’une personne à l’autre. Selon Brysbaert et al. (2016), l’âge et le niveau d’études sont notamment des prédicteurs importants de la taille du vocabulaire. Et contrairement à ce que l’on pourrait penser, le vocabulaire ne semble pas simplement atteindre un maximum à l’âge adulte : il continue à s’enrichir avec l’âge.
L’environnement joue également un rôle important. Les personnes ne sont pas toutes exposées aux mêmes mots au cours de leur vie. La lecture, les conversations, les études, le travail, mais aussi les habitudes culturelles — par exemple les livres que l’on lit, les émissions que l’on regarde ou les contenus que l’on consulte — offrent des occasions différentes de rencontrer et d’apprendre de nouveaux mots. Plus on est exposé à une grande diversité de mots, plus on a de chances d’enrichir son vocabulaire.
Un vocabulaire riche permet de comprendre et d’exprimer plus facilement des idées complexes. Il est notamment étroitement lié à la compréhension de la lecture et aux connaissances générales. La taille du vocabulaire constitue également un bon indicateur de l’intelligence cristallisée, c’est-à-dire des connaissances et compétences acquises au cours de la vie.
Dans une étude menée auprès d’étudiants anglophones, Vermeiren, Vandendaele et Brysbaert (2023) ont développé et validé deux tests de taille du vocabulaire. Les deux tests présentaient une très bonne fiabilité (r > .85) et corrélaient à plus de .40 avec les connaissances générales et la compréhension en lecture. Les analyses montrent que les tests de vocabulaire mesurent principalement un facteur d’intelligence cristallisée, lui-même étroitement lié à la compréhension en lecture.
Vermeiren, H., Vandendaele, A., & Brysbaert, M. (2023). Validated tests for language research with university students whose native language is English: Tests of vocabulary, general knowledge, author recognition, and reading comprehension. Behavior Research Methods. https://doi.org/10.3758/s13428-022-01856-x
Avoir un vocabulaire important ne signifie donc pas seulement connaître davantage de mots : il est associé à une meilleure capacité à comprendre les textes et à un ensemble plus large de connaissances acquises.
Une première version de ce type de test a été mise en ligne sur le site MesMots en 2007. Le test s’appuyait déjà sur la base de données Lexique, une base de données de référence sur le lexique français. Une archive de cette première version est disponible sur la Wayback Machine.
L’idée a ensuite été reprise et développée par Marc Brysbaert et ses collaborateurs, dans la recherche suivante :
Brysbaert, M., Stevens, M., Mandera, P., & Keuleers, E. (2016). How many words do we know? Practical estimates of vocabulary size dependent on word definition, the degree of language input and the participant’s age. Frontiers in Psychology, 7, 1116. Lire l’article scientifique
La présente version s’inscrit dans cette continuité et propose une adaptation au français fondée sur les données lexicales de Lexique, enrichie de développements méthodologiques plus récents. Elle permet notamment de consulter la définition des mots qui n’ont pas été reconnus, afin de découvrir de nouveaux mots et d’enrichir progressivement son vocabulaire en répétant le test.
Les pseudomots (mots inventés) sont extraits du French Lexicon Project. Il est possible de fabriquer des pseudomots en français (et dans d’autres langues) avec Unipseudo.
Un test développé dans le cadre de recherches sur le vocabulaire français.
Ce test a été développé dans le cadre de recherches en psychologie cognitive et en psycholinguistique. Il vise notamment à mieux comprendre la distribution de la taille du vocabulaire dans la population francophone.
Ce test a été conçu par Boris New, professeur de psychologie cognitive à l’Université Savoie Mont Blanc (USMB) et membre du LPNC (Laboratoire de Psychologie et NeuroCognition, UMR CNRS 5105).
1 Un lemme est la forme de base d’un mot, celle que l’on trouve en tête d’article dans un dictionnaire : l’infinitif pour un verbe (manger), le masculin singulier pour un adjectif (grand) ou un nom (boulanger). ↩