La Escala de Depresión Posnatal de Edinburgh es un instrumento psicométrico de tamizaje diseñado para identificar síntomas compatibles con depresión durante el período posnatal. Su importancia clínica radica en que permite detectar, de manera relativamente rápida y estandarizada, a las mujeres que podrían requerir una evaluación diagnóstica más completa. No constituye por sí misma una prueba diagnóstica de depresión: una puntuación elevada indica una mayor probabilidad de presentar un trastorno depresivo y, por tanto, la necesidad de realizar una valoración clínica posterior. El instrumento original fue desarrollado específicamente para superar algunas dificultades de los instrumentos generales de depresión en el período posnatal, particularmente porque muchos síntomas somáticos habituales después del parto, como alteraciones del sueño, fatiga o cambios del apetito, pueden confundirse con síntomas depresivos.
1. Origen y fundamento de la escala
La escala fue desarrollada en 1987 como un instrumento de diez reactivos destinado a la detección de depresión posnatal en la comunidad. Su construcción se realizó después de entrevistas piloto extensas y posteriormente se estudió en 84 mujeres mediante comparación con criterios diagnósticos de depresión obtenidos a través de una entrevista psiquiátrica estandarizada. El estudio original encontró que el instrumento presentaba sensibilidad y especificidad satisfactorias y que también era capaz de detectar cambios en la intensidad de los síntomas depresivos a lo largo del tiempo. Una característica práctica fundamental desde su creación fue su brevedad: puede contestarse aproximadamente en cinco minutos y utiliza un procedimiento de puntuación sencillo.
La lógica que sustenta la escala es particularmente apropiada para el período perinatal porque concentra la evaluación en fenómenos afectivos y cognitivos de la depresión, en lugar de otorgar un peso excesivo a síntomas físicos que pueden aparecer fisiológicamente después del nacimiento. De esta manera, la escala intenta distinguir mejor entre las modificaciones normales asociadas con el puerperio y un patrón de sufrimiento emocional suficientemente intenso como para justificar una investigación clínica. Su desarrollo representó, por ello, una transición desde la identificación exclusivamente clínica de los casos hacia una estrategia sistemática de detección que pudiera aplicarse también en servicios obstétricos, atención primaria y seguimiento posnatal.
2. ¿Qué evalúa exactamente?
La Escala de Depresión Posnatal de Edinburgh contiene 10 preguntas, y cada una posee 4 alternativas de respuesta que representan diferentes grados o frecuencias de determinados síntomas durante los 7 días anteriores. La puntuación de cada reactivo varía entre 0 y 3, por lo que la puntuación total posible se encuentra entre 0 y 30 puntos. La escala, por tanto, no pretende establecer una clasificación dimensional exhaustiva de todos los componentes psicopatológicos de la depresión, sino producir una medida breve de la intensidad de síntomas depresivos relevantes para la detección durante el embarazo y el período posnatal.
Los contenidos evaluados comprenden fundamentalmente el estado de ánimo depresivo, la capacidad para experimentar placer, la presencia de sentimientos de culpa o autodesvalorización, la ansiedad, las dificultades relacionadas con el sueño y determinados pensamientos negativos, además de la presencia de pensamientos de autolesión. Esta composición explica por qué la escala puede proporcionar información clínicamente relevante sin depender exclusivamente de manifestaciones somáticas que podrían ser atribuibles tanto al puerperio como a una enfermedad depresiva.
Un aspecto particularmente importante es que el período de referencia es de 7 días. Por ello, la puntuación debe interpretarse como una representación del estado emocional reciente y no como una descripción de toda la experiencia emocional desde el nacimiento. Esta característica también permite repetir la escala en diferentes momentos y utilizar los cambios de puntuación como información complementaria para valorar la evolución sintomática. El estudio original mostró precisamente sensibilidad a los cambios en la gravedad de la depresión a través del tiempo.
3. ¿Cómo se puntúa?
Cada reactivo se califica de 0 a 3 puntos. Los reactivos están redactados de manera que una de las opciones represente ausencia o mínima intensidad del síntoma y las restantes representen grados progresivamente mayores de sintomatología. Algunos reactivos se encuentran formulados en dirección positiva y otros en dirección negativa; por esta razón, la puntuación debe realizarse siguiendo exactamente la clave correspondiente a la versión validada del instrumento y no simplemente sumando mecánicamente el número de la alternativa seleccionada. La versión mexicana validada conserva diez preguntas y cuatro categorías de respuesta.
La puntuación total se obtiene sumando los diez reactivos. El intervalo teórico es:
Puntuación mínima = 0 puntos
Puntuación máxima = 30 puntos
Una puntuación mayor representa una mayor carga de síntomas depresivos. Sin embargo, no existe un único punto de corte universalmente aplicable a todas las poblaciones y situaciones clínicas. La investigación de validación demuestra que el rendimiento diagnóstico cambia según el idioma, la población estudiada, el momento del período perinatal, el criterio diagnóstico utilizado y el propósito clínico del tamizaje.
Esta cuestión es fundamental. Una puntuación de la escala no posee un significado diagnóstico absoluto independientemente del contexto. La misma puntuación puede tener diferente sensibilidad y especificidad en poblaciones distintas. Una revisión sistemática de estudios de validación encontró una marcada heterogeneidad entre investigaciones, con sensibilidades que variaron entre 34 % y 100 % y especificidades entre 44 % y 100 %, dependiendo del punto de corte y de las características del estudio.
4. Interpretación de los puntos de corte
En términos generales, cuanto mayor es la puntuación, mayor es la probabilidad de que exista sintomatología depresiva clínicamente significativa. Sin embargo, el objetivo del punto de corte determina qué tipo de error se está dispuesto a aceptar.
Un punto de corte bajo aumenta la capacidad para identificar a la mayoría de las personas que realmente presentan depresión, pero también aumenta el número de resultados positivos en mujeres que finalmente no cumplen criterios diagnósticos. Un punto de corte alto aumenta la especificidad, disminuyendo el número de falsos positivos, pero puede dejar sin detectar a algunas mujeres con depresión. Esta relación entre sensibilidad y especificidad explica por qué no debe considerarse que un determinado número sea universalmente equivalente a “depresión posparto”.
La evidencia acumulada más amplia hasta la fecha procede de una revisión sistemática y metanálisis de datos individuales que incluyó 58 estudios, 15 557 participantes y 2 069 casos de depresión mayor. Cuando se utilizó una entrevista semiestructurada como referencia diagnóstica, una puntuación de 10 o más produjo una sensibilidad de 85 % y una especificidad de 84 %; una puntuación de 11 o más produjo una sensibilidad de 81 %y una especificidad de 88 %; mientras que una puntuación de 13 o más produjo una sensibilidad de 66 % y una especificidad de 95 %. El punto de corte de 11 o más maximizó conjuntamente sensibilidad y especificidad en el análisis global.
Por consiguiente, desde una perspectiva de investigación diagnóstica, 11 puntos no significa que una persona tenga depresión y 10 puntos no significa que no la tenga. Significa que, en las poblaciones estudiadas, el umbral de 11 mostró un equilibrio particularmente favorable entre la identificación de verdaderos casos y la exclusión de personas sin depresión. Si la prioridad clínica es minimizar falsos negativos, pueden utilizarse umbrales inferiores; si la prioridad es aumentar la especificidad y seleccionar personas con una carga sintomática mayor, puede utilizarse un umbral superior.
5. Particularidades de la interpretación en México
La interpretación de la escala requiere especial atención cuando se utiliza en población mexicana porque la validación de un instrumento psicológico no depende exclusivamente de traducir literalmente sus palabras. Las expresiones lingüísticas, los significados culturales, las características sociodemográficas y el momento del puerperio pueden modificar el rendimiento de una prueba de tamizaje. Por esta razón, se desarrolló una versión mexicana mediante traducción, adaptación de determinadas expresiones al lenguaje utilizado en México y retrotraducción al inglés realizada por profesores bilingües.
En una investigación realizada en Durango, México, se estudiaron 100 mujeres puérperasdurante los primeros tres meses posteriores al nacimiento. El estudio separó a las participantes en dos grupos porque el momento posnatal modificaba el rendimiento de la escala. Entre las mujeres con menos de 4 semanas después del parto, el punto de corte que ofreció el mejor equilibrio entre sensibilidad y especificidad fue 11/12, con una sensibilidad de 75 %, una especificidad de 93 %, un valor predictivo positivo de 50 %, un valor predictivo negativo de 97.6 % y un área bajo la curva de 0.84.
Entre las mujeres que se encontraban entre 4 y 13 semanas después del parto, el mejor punto de corte identificado fue 7/8. En este grupo, la sensibilidad fue de 75 %, la especificidad de 84 %, el valor predictivo positivo de 46.2 %, el valor predictivo negativo de 94.7 % y el área bajo la curva fue de 0.80. Esta diferencia respecto del grupo con menos de cuatro semanas es una demostración empírica de que el punto de corte no puede interpretarse independientemente del momento posnatal.
Posteriormente, otra investigación mexicana evaluó 411 mujeres durante el posparto y utilizó el Inventario de Depresión de Beck como referencia. Con un punto de corte de 12, la escala presentó una sensibilidad de 70.4 %, una especificidad de 72.2 %, un valor predictivo positivo de 36.9 %, un valor predictivo negativo de 91.4 % y un área bajo la curva de 0.729. Estos resultados muestran que, en una población mexicana diferente, el rendimiento fue moderado y que una proporción importante de resultados positivos no necesariamente correspondía a casos confirmados de depresión.
La consecuencia metodológica es importante: no debería utilizarse un punto de corte de manera automática sin especificar la población, el momento posnatal y el objetivo del tamizaje. Las investigaciones mexicanas muestran que distintos puntos de corte pueden producir resultados sustancialmente diferentes, y los metanálisis internacionales confirman que existe heterogeneidad entre poblaciones.
6. ¿Por qué no es una prueba diagnóstica?
La escala identifica probabilidad de depresión, no establece un diagnóstico definitivo. El diagnóstico de un episodio depresivo requiere integrar síntomas, duración, intensidad, repercusión funcional, antecedentes psiquiátricos, contexto clínico y, cuando corresponde, una entrevista diagnóstica estructurada o semiestructurada. Los estudios de validación de la escala precisamente han comparado sus puntuaciones con entrevistas diagnósticas para determinar qué tan bien puede discriminar entre personas con y sin depresión.
Esta distinción es esencial porque el valor predictivo positivo depende de la prevalencia de la enfermedad en la población evaluada. Incluso una prueba con sensibilidad y especificidad razonablemente elevadas puede generar un número considerable de falsos positivos cuando se aplica a una población donde la prevalencia de depresión es relativamente baja. El estudio mexicano que obtuvo un valor predictivo positivo de 36.9 %con un punto de corte de 12 ilustra claramente este fenómeno: un resultado positivo no equivalía automáticamente a depresión diagnosticada.
Por el contrario, el valor predictivo negativo elevado observado en varias investigaciones significa que una puntuación por debajo del punto de corte puede ser particularmente útil para reducir la probabilidad de depresión, aunque tampoco permite excluirla de manera absoluta cuando existen síntomas clínicamente preocupantes. En la validación mexicana inicial, por ejemplo, el valor predictivo negativo fue de 97.6 % en las mujeres con menos de cuatro semanas posparto y de 94.7 % entre las que se encontraban entre cuatro y trece semanas.
7. La importancia del reactivo 10
Uno de los elementos clínicamente más relevantes de la escala es el reactivo 10, que explora la presencia durante los últimos siete días de pensamientos de hacerse daño. Sus opciones permiten distinguir desde la ausencia de tales pensamientos hasta una frecuencia elevada.
Este reactivo tiene una importancia que excede su contribución matemática a la puntuación total. Una respuesta positiva debe considerarse una señal de seguridad clínica que requiere evaluación adicional del riesgo, independientemente de que la puntuación total se encuentre por debajo del punto de corte utilizado para el tamizaje de depresión. La evaluación del riesgo suicida no puede reducirse a sumar los puntos del cuestionario, porque la gravedad del riesgo depende también de la presencia de intención, plan, medios disponibles, antecedentes de conducta suicida, factores protectores y otros elementos clínicos. Las recomendaciones contemporáneas para la atención perinatal establecen procedimientos específicos para evaluar la suicidabilidad y no consideran suficiente la puntuación global de una escala de depresión.
Por ello, en la práctica clínica, una respuesta positiva al reactivo 10 debe desencadenar una evaluación clínica inmediata del riesgo, incluso cuando la puntuación total no alcance el umbral habitual de tamizaje. La razón es que una puntuación total puede ocultar la importancia cualitativa de un síntoma de seguridad: una persona podría tener relativamente pocos síntomas depresivos y, simultáneamente, presentar pensamientos de autolesión que requieran atención urgente.
8. Diferencia entre depresión posnatal y tristeza posparto
La utilidad de la escala también se comprende mejor al diferenciar la sintomatología depresiva clínicamente relevante de la denominada tristeza posparto. Durante los primeros días posteriores al nacimiento pueden aparecer cambios emocionales transitorios; sin embargo, la presencia persistente, intensa o funcionalmente incapacitante de síntomas depresivos requiere una valoración diferente. La escala no pretende etiquetar automáticamente como enfermedad toda fluctuación emocional propia del puerperio, sino identificar a quienes presentan una carga de síntomas suficiente para justificar una evaluación posterior.
La importancia de realizar esta distinción explica por qué una puntuación elevada debe interpretarse junto con la historia clínica. Una mujer puede obtener una puntuación elevada debido a una combinación de ansiedad, tristeza, sentimientos de culpa, anhedonia o alteraciones emocionales que necesitan evaluación, pero el instrumento por sí mismo no determina si se trata de un episodio depresivo mayor, otro trastorno psiquiátrico, una reacción adaptativa, un cuadro ansioso u otra condición.
9. Uso durante el embarazo
Aunque su nombre hace referencia al período posnatal, la escala también se ha estudiado durante el embarazo. Las investigaciones de validación antenatal han mostrado que sus parámetros diagnósticos pueden variar considerablemente según el estudio, con estimaciones de sensibilidad entre 64 % y 100 % y especificidad entre 73 % y 100 %. Esto demuestra que la escala puede utilizarse en el período prenatal, pero también confirma que su interpretación debe adaptarse a la población y al objetivo de evaluación.
Una validación realizada en mujeres embarazadas mexicanas encontró un punto de corte de 9/10 para la identificación conjunta de depresión mayor y menor, con una sensibilidad de 75.7 %, una especificidad de 74.4 %, un valor predictivo positivo de 50.8 %, un valor predictivo negativo de 94.7 % y un área bajo la curva de 0.89. Esto proporciona evidencia adicional de que el período gestacional y el contexto poblacional influyen en el comportamiento psicométrico de la escala.
10. ¿Por qué es clínicamente útil?
Su utilidad deriva de una combinación de características: es breve, autoadministrada, sencilla de puntuar, específicamente diseñada para el período perinatal y validada en múltiples idiomas y poblaciones. La investigación original mostró que podía completarse aproximadamente en cinco minutos, mientras que las revisiones posteriores han documentado su utilización extensa para el tamizaje de depresión durante el embarazo y después del nacimiento.
El metanálisis más amplio disponible encontró que, con un punto de corte de 11 o más, la escala alcanzó el mejor equilibrio global entre sensibilidad y especificidad para detectar depresión mayor. En estudios que utilizaron entrevistas semiestructuradas como estándar de referencia, la sensibilidad fue de 81 % y la especificidad de 88 %. Estos valores respaldan su utilidad como instrumento de detección, pero simultáneamente muestran que no es perfecta: una parte de los casos puede no ser detectada y otra parte de los resultados positivos puede corresponder a personas que no cumplen criterios diagnósticos.
Una revisión sistemática y metanálisis posterior comparó la escala con otros instrumentos de detección de depresión perinatal. En mujeres posparto, la sensibilidad agrupada fue de 0.79 y la especificidad agrupada de 0.92, mientras que en mujeres embarazadas fueron de 0.81 y 0.87, respectivamente. Estos resultados respaldan un rendimiento diagnóstico global favorable, aunque no eliminan la necesidad de confirmación clínica después de un resultado positivo.
11. Limitaciones
La primera limitación es la variabilidad del punto de corte. No existe un umbral que produzca exactamente el mismo rendimiento en todas las poblaciones. Las diferencias observadas entre estudios se explican por características demográficas, culturales y clínicas, momento de aplicación, prevalencia de depresión, estándar diagnóstico utilizado y finalidad del tamizaje.
La segunda limitación es que el instrumento depende del autoinforme. La persona evaluada debe reconocer y comunicar sus propios síntomas, por lo que factores como la comprensión de las preguntas, la disposición para revelar síntomas, el estigma y el contexto de aplicación pueden influir en las respuestas. La traducción y adaptación cultural son, por ello, componentes esenciales de la validación de cualquier versión lingüística.
La tercera limitación es que la escala no evalúa de manera exhaustiva todos los trastornos mentales perinatales. Una puntuación baja no excluye necesariamente ansiedad clínicamente importante, trastorno bipolar, trastorno por estrés postraumático, psicosis posparto u otras condiciones. Las recomendaciones contemporáneas de atención perinatal aconsejan realizar un proceso de evaluación de salud mental más amplio y utilizar instrumentos validados para diferentes dominios cuando exista indicación clínica.
La cuarta limitación es que el tamizaje solamente resulta clínicamente útil cuando existe un sistema de evaluación, diagnóstico, tratamiento y seguimiento. Una prueba positiva sin posibilidad de realizar una valoración posterior puede generar incertidumbre y no necesariamente mejora los resultados de salud. Las recomendaciones clínicas actuales enfatizan precisamente que la aplicación de instrumentos debe estar vinculada a mecanismos que permitan realizar evaluación diagnóstica, tratamiento y seguimiento oportunos.
12. Aplicación clínica correcta
La aplicación apropiada puede conceptualizarse como un proceso de varias etapas. Primero, se administra la escala y se obtiene la puntuación total. Segundo, se interpreta la puntuación utilizando un punto de corte apropiado para la población y el propósito clínico. Tercero, se revisan individualmente los reactivos, especialmente el relacionado con pensamientos de autolesión. Cuarto, cuando existe un resultado positivo o síntomas clínicos relevantes, se realiza una valoración diagnóstica. Finalmente, si se confirma un trastorno depresivo o existe una sintomatología clínicamente significativa, se establece el manejo y el seguimiento correspondientes.
Las recomendaciones clínicas actuales consideran apropiado realizar detección estandarizada de depresión y ansiedad durante la atención prenatal y posparto, utilizando instrumentos validados. La Escala de Depresión Posnatal de Edinburgh es uno de los instrumentos reconocidos para esta finalidad. Además, se recomienda que el tamizaje no constituya un procedimiento aislado, sino que esté integrado dentro de un sistema capaz de proporcionar evaluación diagnóstica, tratamiento y seguimiento.
13. Interpretación práctica resumida
Desde una perspectiva estrictamente científica, la interpretación puede sintetizarse de la siguiente manera:
0 a 30 puntos: intervalo completo de puntuación posible; un número mayor representa mayor intensidad de síntomas depresivos.
Puntuaciones cercanas a los valores inferiores: hacen menos probable la presencia de depresión mayor, aunque no la excluyen absolutamente si existe sintomatología clínica significativa.
Puntuaciones alrededor de 10 a 12 puntos: constituyen una zona en la que la decisión sobre el punto de corte adquiere especial importancia. El metanálisis internacional de mayor tamaño encontró que 11 o más optimizaba globalmente la combinación de sensibilidad y especificidad.
13 puntos o más: aumenta la especificidad respecto de puntos de corte inferiores, aunque disminuye la sensibilidad; por ello puede resultar útil cuando se pretende identificar una proporción mayor de mujeres con sintomatología más intensa, pero no necesariamente es el mejor umbral cuando la prioridad es minimizar casos no detectados.
En población mexicana: los estudios de validación han producido diferentes puntos de corte según el momento posnatal. En mujeres con menos de 4 semanas después del parto se identificó 11/12, mientras que entre 4 y 13 semanas se identificó 7/8 en la validación mexicana inicial. Otro estudio realizado en México obtuvo un rendimiento moderado con un punto de corte de 12, lo que refuerza la necesidad de contextualizar la interpretación.
Reactivo 10 positivo: requiere evaluación específica del riesgo de autolesión, independientemente de que la puntuación total supere o no el punto de corte.
14. Conclusión
La Escala de Depresión Posnatal de Edinburgh constituye uno de los instrumentos de tamizaje más importantes para la identificación sistemática de síntomas depresivos durante el período perinatal. Su fortaleza principal reside en combinar una administración breve con una estructura específicamente adaptada al contexto posnatal y una amplia base de evidencia psicométrica. El instrumento fue concebido originalmente como una herramienta de detección y no como sustituto de la evaluación psiquiátrica o psicológica.
La evidencia acumulada demuestra que su rendimiento es suficientemente bueno para justificar su utilización como instrumento de tamizaje, pero también demuestra que la puntuación debe interpretarse contextualmente. Los puntos de corte varían entre poblaciones, idiomas y momentos del período perinatal; por ello, no es científicamente correcto afirmar que una puntuación determinada equivale universalmente a depresión posparto. En México, además, existen estudios específicos de validación que demuestran variaciones en el rendimiento según el momento posterior al nacimiento y según la población evaluada.
El valor fundamental de la escala no consiste en “diagnosticar” por sí misma a una mujer con depresión, sino en reducir la probabilidad de que una sintomatología depresiva clínicamente relevante pase inadvertida. Una puntuación elevada debe conducir a una evaluación clínica, mientras que una respuesta relacionada con autolesión debe recibir atención específica por razones de seguridad. Cuando se integra adecuadamente dentro de un sistema de detección, diagnóstico, tratamiento y seguimiento, la escala constituye una herramienta de gran utilidad para la atención de la salud mental durante el embarazo y después del nacimiento.
Fuente y lecturas recomendadas:
- Alvarado-Esquivel, C., Sifuentes-Alvarez, A., Salas-Martinez, C., & Martínez-García, S. (2006). Validation of the Edinburgh postpartum depression scale in a population of puerperal women in Mexico. Clinical Practice and Epidemiology in Mental Health, 2, 33. https://doi.org/10.1186/1745-0179-2-33
- American College of Obstetricians and Gynecologists. (2023). Screening and diagnosis of mental health conditions during pregnancy and postpartum: Clinical Practice Guideline No. 4. American College of Obstetricians and Gynecologists.
- Cox, J. L., Holden, J. M., & Sagovsky, R. (1987). Detection of postnatal depression: Development of the 10-item Edinburgh Postnatal Depression Scale. The British Journal of Psychiatry, 150(6), 782–786. https://doi.org/10.1192/bjp.150.6.782
- Garcia-Esteve, L., Ascaso, C., Ojuel, J., & Navarro, P. (2003). Validation of the Edinburgh Postnatal Depression Scale in Spanish mothers. Journal of Affective Disorders, 75(1), 71–76. https://doi.org/10.1016/S0165-0327(02)00020-4
- Gibson, J., McKenzie-McHarg, K., Shakespeare, J., Price, J., & Gray, R. (2009). A systematic review of studies validating the Edinburgh Postnatal Depression Scale in antepartum and postpartum women. Acta Psychiatrica Scandinavica, 119(5), 350–364. https://doi.org/10.1111/j.1600-0447.2009.01363.x
- Kozinszky, Z., & Dudas, R. B. (2015). Validation studies of the Edinburgh Postnatal Depression Scale for the antenatal period. Journal of Affective Disorders, 176, 95–105. https://doi.org/10.1016/j.jad.2015.01.044
- Levis, B., Negeri, Z., Sun, Y., Benedetti, A., & Thombs, B. D. (2020). Accuracy of the Edinburgh Postnatal Depression Scale for screening to detect major depression among pregnant and postpartum women: Systematic review and meta-analysis of individual participant data. BMJ, 371, m4022. https://doi.org/10.1136/bmj.m4022
- Vega-Dienstmaier, J. M., Mazzotti Suárez, G., & Campos Sánchez, M. (2002). Validation of a Spanish version of the Edinburgh Postnatal Depression Scale. Actas Españolas de Psiquiatría, 30(2), 106–111.


