Ir al contenido
OneKitly

Mil palabras francesas cubren el 80% — y no te dicen nada

Publicado el 10/3/2026 · 19 min de lectura · Calculadoras del día a día

Lena Hoffmann

Lena HoffmannRedactora de Ciencia y Educación en OneKitly

Matemáticas · Física

Verificado con 6 fuentes

Ver perfil
En resumen

Sobre 312 994 233 palabras de subtítulos franceses, las 100 formas más frecuentes cubren el 57,68 % del texto corriente, las 1 000 primeras el 80,77 % y las 2 000 primeras el 85,90 %. Esos números son exactos, y son también la estadística más sobrevendida del aprendizaje de idiomas, por cuatro razones. Primera: el denominador es una porción de 50 000 formas, no la lengua. Medidas contra el corpus entero — 834 768 formas distintas, 318 214 450 palabras — las 1 000 primeras cubren el 79,45 %, y llegar al 95 % exige 13 909 formas y no las 9 556 que sugiere la porción truncada. Segunda: esto es diálogo de cine y televisión. je ocupa el puesto 2, vous el 8, tu el 9, y solo los pronombres de primera y segunda persona pesan el 9,09 % de todas las palabras pronunciadas, frente al 2,10 % de il, elle, ils y elles juntos. Tercera: una forma no es una entrada de diccionario. Las 1 000 primeras formas son 912 lemas, una contracción del 8,8 %, menor de lo que se supone. Cuarta, y este es el punto: el 80 % que conocerías es casi todo gramática. Las 100 primeras formas aportan por sí solas el 71,4 % de ese 80 %, y el nombre común mejor clasificado entre ellas es chose, «cosa», en el puesto 92. Toma la frase «Il a dit qu'on ne pouvait pas savoir si le prévenu avait été mis en examen pour recel aggravé.» Dieciséis de sus veinte ocurrencias están en el top 1 000 — exactamente el 80 % de cobertura — y las cuatro restantes son prévenu, examen, recel y aggravé. Un lector con dominio perfecto de las 1 000 primeras formas lee «Il a dit qu'on ne pouvait pas savoir si le ___ avait été mis en ___ pour ___ ___» y no ha aprendido nada.

Medimos la curva de cobertura del francés sobre 313 millones de palabras de subtítulos: las 1 000 formas más frecuentes suponen el 80,77 % del texto corriente. Luego tomamos una frase francesa normal en la que el 80 % de las ocurrencias está dentro de ese top 1 000, y mostramos que un lector que las conoce todas no saca nada de ella.

Qué mide realmente la cifra del 80%

La medición detrás de la afirmación es sencilla y es honesta. Toma un gran conjunto de francés, cuenta cada aparición de palabra, ordena las formas distintas por frecuencia y pregunta: si recorriera el texto conociendo solo las N formas más frecuentes, ¿qué fracción de las palabras encontradas reconocería? Esa fracción se llama cobertura. Nuestras cifras vienen de 312 994 233 palabras de subtítulos franceses, donde se contaron 50 000 formas distintas. Las 10 formas más frecuentes cubren por sí solas el 18,54 % de todo lo dicho. Las 100 primeras cubren el 57,68 %. Las 1 000 primeras cubren el 80,77 %, y las 2 000 primeras el 85,90 %.

Merece la pena ver la cabeza de esa lista antes de sacar nada de ella. En orden, las veinte formas más frecuentes del francés en este corpus son: de, je, est, pas, le, que, la, vous, tu, un, c', à, et, il, a, l', ne, les, j', en. Ni un sustantivo entre ellas, ni un adjetivo, ni un verbo que nombre una acción en lugar de un auxiliar. Son el tejido conectivo de la lengua — preposiciones, pronombres, artículos, negación, cópula. Por eso justamente son frecuentes: el francés las necesita en casi cada frase, sea cual sea el tema de la frase.

La curva que trazan esas formas es muy pronunciada al principio y luego casi plana, que es la forma general de la frecuencia de palabras en todas las lenguas — el artículo del sitio sobre la ley de Zipf ajusta la pendiente en seis libros en seis lenguas y no se volverá a derivar aquí. Lo que importa para quien aprende es la consecuencia práctica de esa forma. Ir de cero al 80 % de cobertura cuesta unas mil formas. Ir del 80 % al 90 % cuesta unas cuatro mil más. Ir del 90 % al 95 % cuesta nueve mil más encima. Cada punto adicional de cobertura se compra a un precio que sube en vertical, y las cuatro reservas de este artículo dicen todas por qué esos últimos puntos importan mucho más que los ochenta primeros.

Reserva 1: el denominador es una porción de 50 000 formas, no el francés

Cada cifra de la primera columna de la tabla es un porcentaje de una lista que se detiene en 50 000 formas. El francés real no se detiene ahí. El mismo editor publica también la lista sin truncar de este corpus, y contiene 834 768 formas distintas en 318 214 450 palabras — de las cuales la porción de 50 000 formas supone el 98,360 %. La porción no es una muestra pequeña, pero tampoco es el todo, y cada cobertura calculada dentro de ella está inflada por un factor de aproximadamente 1,017. Contra el denominador real, las 1 000 primeras formas cubren el 79,45 % y no el 80,77 %, y las 2 000 primeras el 84,49 % y no el 85,90 %. Ambas columnas están en la tabla para que veas el tamaño de la corrección en vez de creerla de palabra.

Un punto y medio suena a error de redondeo. No lo es, por el lugar de la curva donde cae el error. Formulado al revés — cuántas formas hacen falta para alcanzar una cobertura dada —, la porción truncada dice que 9 556 formas alcanzan el 95 % y 20 984 alcanzan el 98 %. El corpus entero dice que 13 909 formas alcanzan el 95 % y 40 652 alcanzan el 98 %. Donde la curva es plana, un error pequeño de cobertura se vuelve un error enorme de tamaño de vocabulario: en el umbral del 98 %, el denominador truncado subestima la exigencia por un factor de casi dos. Quien cite un objetivo de vocabulario sacado de una lista de frecuencia truncada cita un número equivocado en la dirección que le conviene.

La cola tampoco está vacía de lo que te interesaría. De las 834 768 formas de la lista completa, 389 191 — casi la mitad del vocabulario del corpus — aparecen exactamente una vez en 318 millones de palabras. Son nombres propios, erratas, palabras extranjeras y rarezas genuinas; individualmente insignificantes, colectivamente el 0,12 % del texto. Pero la banda entre el puesto 20 000 y el 50 000 no está hecha de ruido: contiene francés ordinario, aburrido, perfectamente aprendible, que un subtitulador usó unos cientos de veces y que una tabla de cobertura redondea a nada.

Reserva 2: esto es diálogo de cine, y la clasificación lo demuestra

El corpus es OpenSubtitles: lo que la gente se dice en pantalla. El registro se ve en la clasificación sin ningún aparato estadístico. je es la segunda forma más frecuente de la lengua según esta lista; vous es octava y tu novena. En masa de ocurrencias, los pronombres personales de primera y segunda persona — je, j', me, m', moi, nous, tu, t', te, toi, vous — pesan el 9,09 % de todas las palabras del corpus, mientras que los pronombres sujeto de tercera persona il, elle, ils y elles juntos pesan el 2,10 %. En prosa narrativa o en prensa esa proporción está invertida. Veintitrés de las cien formas más frecuentes son marcas de primera o segunda persona, y la lista contiene además non en el puesto 42, oui en el 54, quoi en el 61, pourquoi en el 75, bon en el 93 y merci en el 95.

Hay una segunda huella, más nítida. Entre las 2 000 primeras formas, 67 son bloques con guion formados por un verbo y su pronombre: est-ce, avez-vous, a-t-il, es-tu, dis-moi, laissez-moi, allez-y, vas-y, excusez-moi. Son cosas que se dicen en voz alta a alguien que está delante. Un periódico francés no contiene casi ninguna. La descripción honesta de la primera columna de la tabla no es, pues, «cobertura del francés» sino «cobertura del francés hablado tal como lo escriben los subtituladores», y la curva de cobertura de una novela o de un diario sería más plana y más baja en cada puesto, porque los registros escritos reparten sus ocurrencias sobre un vocabulario más amplio. Cuánto, no podemos decirlo: haría falta un segundo corpus, y este artículo mide solo el que tiene.

Reserva 3: una forma no es una entrada de diccionario — pero la diferencia es solo del nueve por ciento

Una lista de frecuencia cuenta formas de superficie. est, a, été, sont y ont son cinco entradas en ella y dos verbos en un diccionario. Así que «1 000 palabras» no es lo que da la lista: da 1 000 formas, que son menos palabras. Medimos la contracción contra el propio léxico francés del sitio, 46 159 entradas importadas del Wiktionnaire, resolviendo cada forma hacia su lema cuando la entrada se declara flexión de otra. Las 100 primeras formas son 91 lemas distintos, de los cuales 21 son formas flexionadas. Las 500 primeras son 453 lemas, con 120 flexiones. Las 1 000 primeras son 912 lemas, con 239 flexiones. Las 2 000 primeras son 1 816 lemas, con 480 flexiones. La contracción es del 9,0 %, 9,4 %, 8,8 % y 9,2 % respectivamente.

Lo llamativo es lo pequeño que resulta. La corrección que se espera aquí es espectacular — divide por dos, se dice, porque los verbos franceses se conjugan. Es del nueve por ciento, y es estable en todo el rango. La razón es que la cabeza de la lista es mayoritariamente invariable: preposiciones, artículos, pronombres y adverbios no tienen paradigma que contraer, y los verbos que aparecen arriba del todo son tan pocos que ni siquiera todas sus formas juntas mellan la cuenta. Otra cuestión es si esas formas están siquiera en un diccionario: el 94,0 % de las 2 000 primeras tiene entrada en el léxico del sitio. El 6 % restante está dominado por cadenas de las que ningún diccionario hace un lema — los 14 clíticos elididos c', j', l', d', qu', n', s', t', m' y sus semejantes, los 67 bloques verbo-pronombre con guion, y dos abreviaturas. Las elisiones por sí solas son 14 formas: no pueden ser la totalidad de un hueco de unas 120. El enunciado honesto es que la mayor parte del hueco es estructural, y el resto es la incompletitud ordinaria de cualquier diccionario.

Reserva 4: el 80% que conoces no lleva casi nada del significado

Las tres primeras reservas recortan la cifra. Esta la desmonta. La cobertura pesa cada ocurrencia por igual: le cuenta tanto como prévenu. Pero las dos no llevan la misma cantidad de información, y la clasificación está construida de modo que las ocurrencias que menos llevan están arriba del todo. Del 80,77 % que cubren las mil primeras formas, las cien primeras aportan el 71,4 % — todo el tramo de 900 formas del puesto 101 al 1 000 añade solo 23,09 puntos al total. ¿Y qué hay en esa primera centena? Preposiciones, artículos, pronombres, la negación, los auxiliares, un puñado de verbos muy frecuentes como faire, dire y savoir, y las muletillas de conversación oui, non, bon y merci. El sustantivo común mejor clasificado de toda la centena es chose — «cosa» — en el puesto 92. Un vocabulario que no nombra nada no puede decirte de qué trata una frase.

Aquí está la demostración, sobre una frase de francés perfectamente ordinaria: «Il a dit qu'on ne pouvait pas savoir si le prévenu avait été mis en examen pour recel aggravé.» Tiene veinte ocurrencias. Dieciséis están dentro del top 1 000 — il en el puesto 14, a en el 15, dit en el 71, qu' en el 26, on en el 21, ne en el 17, pouvait en el 697, pas en el 4, savoir en el 200, si en el 38, le en el 5, avait en el 125, été en el 99, mis en el 397, en en el 20, pour en el 27. Eso es exactamente el 80 % de cobertura, la cifra estrella, lograda sobre una frase real. Las cuatro ocurrencias que quedan fuera son prévenu (puesto 2 710), examen (2 175), recel (26 425) y aggravé (20 608).

Lee ahora lo que ve realmente el lector que domina a la perfección el top 1 000 y nada más allá: «Il a dit qu'on ne pouvait pas savoir si le ___ avait été mis en ___ pour ___ ___.» Sabe que hay un hombre, que alguien dijo algo sobre él, que no era averiguable, y que el tiempo es pasado. No sabe quién es ese hombre, qué le ocurrió, ni de qué se le acusa — es decir, todo el contenido de la frase. Peor: una de las cuatro incógnitas es una trampa para quien sabe a medias. examen parece un examen escolar, y mis en examen es una locución jurídica fija. Entender las piezas produce aquí una lectura falsa y segura de sí en lugar de un hueco. Esa es la distancia entre el 80 % de cobertura y la comprensión, y no se cierra poco a poco — se cierra cuando llegan las palabras con contenido, miles de puestos más abajo en la lista.

La cifra que merece la pena perseguir, y lo que cuesta en horas de estudio

La literatura sobre tamaño de vocabulario no usa el 80% como umbral de nada, porque nadie lee al 80%. El estudio de Nation de 2006 sitúa la cobertura necesaria para una comprensión autónoma en el 98%, y estima el vocabulario requerido para alcanzarla en inglés entre 8 000 y 9 000 familias de palabras para el texto escrito y entre 6 000 y 7 000 para el hablado. Laufer y Ravenhorst-Kalovski encuentran el mismo umbral óptimo del 98%, en torno a 8 000 familias, con un umbral mínimo del 95% en 4 000-5 000 familias por debajo del cual la comprensión se degrada bruscamente. El trabajo de Cobb sobre la misma cuestión es donde mirar si quieres el debate sobre si la lectura por sí sola puede llevarte allí. Sus números son familias de palabras inglesas y los nuestros formas de superficie francesas: los dos tamaños de vocabulario no son comparables — pero los umbrales de cobertura sí lo son, y dicen lo mismo: el 80% no es un hito, es la línea de salida.

Aplicados a este corpus, esos umbrales tienen precio. Alcanzar el 95% del francés hablado tal como se subtitula cuesta unas 13 909 formas. Alcanzar el 98% cuesta unas 40 652. No es motivo de desesperación, es motivo para dejar de tratar las mil primeras como un logro y empezar a tratarlas como gratuitas. Lo son: llegan solas en unas semanas, porque no se lee una página sin cruzarse varias veces con de, je, est y pas. Lo que cuesta tiempo es todo lo que viene después, y lo que abarata ese coste es elegir el registro que quieres. Si piensas leer prensa, la lista de frecuencia de los subtítulos no te dará el vocabulario de la prensa, por muy hondo que bajes en ella.

Para un presupuesto de tiempo en lugar de uno de palabras, la calculadora de esta página es el instrumento honesto. Escala las categorías de dificultad del Foreign Service Institute, que sitúan el francés en el grupo más fácil para un anglohablante, y pregunta por tu ritmo real. Con sus supuestos por defecto — francés, nivel objetivo B2, primer idioma extranjero, una hora al día cinco días por semana — devuelve 600 horas de estudio, que a ese ritmo son 120 semanas, algo menos de veintiocho meses. Cambia el ritmo a dos horas al día seis días por semana y esas mismas 600 horas caben en 50 semanas. La curva de vocabulario te dice qué compras con esas horas; la calculadora te dice cuántas hacen falta al ritmo que de verdad vas a mantener.

Parte de la porción de 50 000 formas
Parte acumulada del texto corriente francés cubierta por las N formas más frecuentes — medida dos veces, sobre la porción de 50 000 formas y sobre el corpus de subtítulos 2018 completo
N formas más frecuentesParte de la porción de 50 000 formasParte del corpus completo
1018,54 %18,24 %
5046,65 %45,88 %
10057,68 %56,74 %
25068,42 %67,30 %
50075,05 %73,81 %
1 00080,77 %79,45 %
2 00085,90 %84,49 %
3 00088,57 %87,12 %
5 00091,64 %90,14 %
10 00095,21 %93,64 %
20 00097,85 %96,25 %
50 000100,00 % (por construcción)98,36 %

Ejemplo calculado con nuestra herramienta

Calculadora de horas de aprendizaje hasta la fluidez

Datos

Idioma objetivo
Español (cat. I)
Nivel objetivo (MCER)
A1
Horas de estudio por día
0,5
Días de estudio por semana
3
Experiencia previa
Primer idioma extranjero

Resultado

Horas de estudio totales
100
Semanas a tu ritmo
66,667
Meses a tu ritmo
15,343

Estas cifras las produce la calculadora de abajo, no se escriben a mano — se recalculan cada vez que la herramienta cambia.

Rehacerlo con tus cifras

En este sitio

Preguntas frecuentes

Entonces, ¿«1 000 palabras son el 80% del francés» es sencillamente falso?
Es aritméticamente defendible y retóricamente deshonesto, que es peor combinación que ser falso. La aritmética: en este corpus las 1 000 primeras formas suponen efectivamente el 80,77 % de las ocurrencias dentro de la porción de 50 000 formas, y el 79,45 % del corpus entero. La deshonestidad está en lo que la frase invita a concluir. «El 80% del francés» suena a «entenderás cuatro frases de cada cinco», y significa «cuatro palabras de cada cinco te resultarán familiares»: dos afirmaciones radicalmente distintas, porque la quinta palabra es donde vive el significado. Una versión más exacta del mismo hecho verdadero sería: las mil primeras formas del francés son la gramática, llegan rápido, y una vez que las tienes la lengua todavía no ha empezado.
Entonces, ¿cuántas palabras francesas necesito de verdad?
Apunta a una cifra de cobertura, no a un número de palabras, y luego convierte. El consenso de la investigación es que la comprensión autónoma necesita alrededor del 98% de cobertura, y que el 95% es el suelo por debajo del cual leer se vuelve descifrar. En este corpus de francés hablado, el 95% de cobertura cuesta unas 13 909 formas y el 98% unas 40 652. Son formas de superficie en un solo registro: por tanto son una cota superior de las entradas de diccionario y una cota inferior de lo que exigiría un periódico — el nueve por ciento de ellas se pliega sobre lemas compartidos, y un corpus escrito repartiría la misma cobertura sobre más vocabulario. Cualquier respuesta del orden de unos pocos miles responde a otra pregunta: cuántas palabras para seguir una conversación sencilla sobre cosas familiares, que es real, útil, y no es lo mismo que entender el francés.
¿Importa de verdad que la lista cuente formas y no palabras de diccionario?
Menos de lo que se supone, al menos en la cabeza de la lista. Lo medimos: las 1 000 primeras formas se resuelven en 912 lemas distintos, y la cifra es 91 para las 100 primeras, 453 para las 500 primeras y 1 816 para las 2 000 primeras — una contracción de entre el 8,8 % y el 9,4 % en todo el rango. La intuición de que la conjugación francesa debe partir la cuenta por la mitad es falsa para esta parte de la lista, porque la cabeza está dominada por palabras invariables. Donde sí importa es en lo práctico, no en lo estadístico: la lista te dará avait y été como dos entradas separadas, y si las aprendes por separado has aprendido dos hechos en vez de un sistema. El remedio no cuesta nada — busca la forma, y la entrada del diccionario te dirá que es una forma de avoir o de être y no una palabra por derecho propio.
¿Serían distintas las cifras para un periódico o una novela?
Sí, y en la dirección que empeora la afirmación del 80% en vez de mejorarla. Los registros escritos usan un vocabulario más amplio para decir lo mismo, así que sus curvas de frecuencia son más planas: las mil primeras formas cubrirían menos, y cada umbral quedaría más abajo en la lista. La prueba dentro de nuestros propios datos es la huella de registro — pronombres de primera y segunda persona al 9,09 % de todas las ocurrencias, 67 formas de inversión oral como avez-vous y dis-moi dentro de las 2 000 primeras, merci en el puesto 95. Nada de eso pertenece al francés de prensa. Lo que no podemos hacer es darte el tamaño de la diferencia, porque haría falta un segundo corpus de francés escrito medido igual, y este artículo mide el corpus que tiene en vez de estimar el otro.
¿Valen estas cifras también para el inglés, el alemán o el italiano?
La forma sí; las cifras no. Toda lengua produce la misma curva de frecuencia, empinada y luego plana, que es la ley de Zipf, y el artículo del sitio sobre ella ajusta esa pendiente en seis lenguas. Pero las cifras concretas de aquí — 80,77 % en el puesto 1 000, 13 909 formas para el 95 %, la contracción forma-lema del 9 % — se midieron sobre el francés y pertenecen al francés. Una lengua morfológicamente más rica reparte sus ocurrencias sobre más formas y se contraería más hacia los lemas; una más analítica haría lo contrario. No las hemos medido, así que no las vamos a citar. Todo en esta página trata de cuánto francés necesitas, que es justo lo que quieres saber sea cual sea la lengua en la que lees esta página.

Artículos que podrían interesarte

Todas las guías
Tutorial¿Cuánto se tarda en leer un libro?Estima el tiempo de lectura a partir del número de palabras y la velocidad de lectura. Descubre la fórmula sencilla, la media de unas 250 palabras por minuto y un ejemplo con una novela completa.ExplicaciónContar caracteres frente a un límite que ha puesto otroUn emoji vale 1 carácter, o 7, o 11, o 25, según quién cuente. Cuál quieren decir tu formulario, tu base de datos y tu pasarela de SMS, y una prueba de un solo pegado para saber a cuál te enfrentas.ExplicaciónQué miden realmente los índices de legibilidad (y las tres cosas que no ven)El Flesch Reading Ease y el nivel Flesch-Kincaid cuentan sílabas y longitud de frase. Nada más. Las dos fórmulas completas, un pasaje puntuado de principio a fin y el truco de la coma que regala 3,9 cursos sin cambiar una palabra.Tutorial¿Cuánto tarda en descargarse un archivo? Tiempo, bits y bytes, y sobrecargaEstima el tiempo de descarga a partir del tamaño del archivo y la velocidad de conexión. Aprende la fórmula tamaño ÷ velocidad, la conversión clave entre bits y bytes (dividir entre 8) y por qué las descargas reales van más lentas de lo que predice el cálculo.Explicación¿Con qué rapidez lees? Velocidad media de lectura y cómo medirlaLa mayoría de los adultos lee prosa a unas 200-250 palabras por minuto. Descubre qué es una velocidad normal, cómo medir la tuya en un minuto y por qué la comprensión importa más que la velocidad pura.Explicación¿Qué es un slug de URL? Por qué en minúsculas, con guiones y bueno para el SEOUn slug de URL es la parte legible y con guiones de una dirección web que nombra una página. Descubre por qué los slugs van en minúsculas, cómo ayudan al SEO y cómo generar uno a partir de un título.

Herramientas relacionadas

Este artículo mide un corpus. Las frecuencias proceden de subtítulos de cine y televisión recogidos en 2018, y otro corpus — un periódico, una novela, un manual — movería cada número de la tabla. La cobertura es una propiedad de un texto, no de una persona: cuenta cuántas palabras del hilo del texto reconocerías, no cuánto entenderías, y este artículo existe para mantener las dos cosas separadas. Nada de lo que sigue promete a qué velocidad aprende nadie, y las horas de estudio citadas son medias de enseñanza institucional, no tu calendario.

Fuentes

¿Has detectado un error en este artículo?