Capítulo 88. Estándares de resultados y calidad de la evidencia
Sinopsis
Sección titulada «Sinopsis»Una intervención para la presbicia puede mejorar la agudeza próxima y, al mismo tiempo, no resolver la tarea que motivó la consulta. Puede ampliar una curva de desenfoque, pero reducir contraste nocturno; disminuir el uso de gafas, pero generar un rescate, una reintervención o una molestia que el promedio oculta. Juzgar resultados exige responder cuatro preguntas separadas: qué se midió, cómo se midió, cuánto cambió y con qué certeza puede atribuirse el cambio a la intervención.
Este capítulo propone un conjunto mínimo que une función visual, refracción, experiencia del paciente, seguridad y concordancia con la meta individual. Normaliza lo que debe documentarse en agudeza, curva de desenfoque, contraste, lectura, pupila, fenómenos fóticos e independencia de gafas. También explica cómo elegir e interpretar PROM, diseñar comparaciones, leer ensayos de no inferioridad, integrar datos observacionales y evaluar revisiones y metaanálisis en red.
El objetivo no es sustituir el juicio clínico por una puntuación metodológica. Es hacer visible qué parte de una afirmación está observada, cuál es inferida, qué incertidumbre conserva y si responde a la vida del paciente. Una medición rigurosa permite comparar tecnologías; una conversación rigurosa determina si esa diferencia importa en una persona concreta.
Objetivos de aprendizaje
Sección titulada «Objetivos de aprendizaje»Al finalizar el capítulo, el lector podrá:
- definir un conjunto mínimo de resultados para presbicia;
- diferenciar constructo, instrumento, métrica, momento y estimando;
- estandarizar agudeza a lejos, intermedio y cerca;
- interpretar una curva de desenfoque sin convertirla en visión real;
- medir contraste, glare, pupila y lectura de forma reproducible;
- definir independencia de gafas y rescates sin ambigüedad;
- seleccionar NAVQ-P, PICQ, QoV u otro PROM según propósito;
- distinguir validez de contenido, fiabilidad, validez de constructo y respuesta al cambio;
- separar significación estadística, importancia clínica, precisión y certeza;
- evaluar superioridad, no inferioridad y equivalencia;
- reconocer sesgo en ensayos y estudios observacionales;
- leer comparaciones directas y metaanálisis en red;
- aplicar GRADE por desenlace; y
- utilizar un marco PECO para predicción, exploración, confirmación y optimización.
1. Medir antes de declarar éxito
Sección titulada «1. Medir antes de declarar éxito»«Funciona» no es un desenlace. Puede significar leer J1, alcanzar 0,0 logMAR a 40 cm, obtener visión funcional desde lejos hasta −2,50 D, no usar gafas, reducir una puntuación de dificultad, volver a conducir de noche o preferir el resultado pese a halos. Cada frase describe un constructo diferente.
El primer paso es escribir la meta antes del tratamiento y convertirla en variables observables. Si el objetivo es leer partituras a 80 cm, la agudeza próxima a 40 cm no basta. Si la prioridad es conducción nocturna, una curva fotópica de alto contraste no responde. Si el paciente acepta gafas para letra pequeña, «independencia total» puede ser irrelevante.
El conjunto estándar de catarata propuesto por un grupo internacional incluye riesgo basal, agudeza y función referida antes de cirugía; y agudeza, refracción, función y complicaciones después, con recogida hasta 3 meses [1]. Es un punto de partida útil, pero la presbicia exige añadir distancia intermedia, lectura, fenómenos fóticos, corrección por distancia, objetivo binocular y evolución del cristalino.
1.1. El resultado tiene cinco componentes
Sección titulada «1.1. El resultado tiene cinco componentes»Todo desenlace debe especificar:
- constructo: lo que se quiere conocer, por ejemplo dificultad de cerca;
- variable: el dato observado, por ejemplo puntuación NAVQ-P;
- métrica: valor final, cambio, proporción que alcanza umbral o tiempo hasta evento;
- agregación: media, mediana, riesgo, tasa o distribución;
- momento: día, mes o año y ventana permitida.
Dos artículos que dicen medir «visión próxima» pueden usar constructos incompatibles. Uno registra agudeza monocular corregida; otro lectura binocular sin corrección; otro pregunta por móvil con la corrección habitual. La etiqueta común no autoriza una media común.
1.2. Beneficio, daño y carga
Sección titulada «1.2. Beneficio, daño y carga»El conjunto mínimo contiene al menos un beneficio objetivo, uno funcional referido por el paciente, daños y carga del tratamiento. La carga incluye tiempo de adaptación, colirios, mantenimiento, limpieza, visitas, gafas de rescate, retoques y coste. Una mejora pequeña conseguida con vigilancia intensa no equivale a la misma mejora estable sin rescate.
Se registran tanto resultados deseados como no deseados. La ausencia de una complicación grave no demuestra ausencia de disfotopsia; un PROM de satisfacción no sustituye recuento de explantes; un buen equivalente esférico no excluye cilindro o superficie que limita lectura.
2. Conjunto mínimo específico para presbicia
Sección titulada «2. Conjunto mínimo específico para presbicia»Un protocolo completo puede ser extenso, pero la comparación exige un núcleo común. La evaluación clínica individual puede añadir pruebas según intervención y tarea.
2.1. Dominio basal
Sección titulada «2.1. Dominio basal»Se documentan edad, sexo cuando sea relevante, ocupación/tareas, estado fáquico o pseudofáquico, catarata, cirugías previas, comorbilidad ocular, ojo dominante, refracción manifiesta y agudeza corregida por ojo. También superficie, pupila bajo condiciones definidas, binocularidad, expectativas y corrección habitual.
La meta se formula con distancias y condiciones. «Ordenador» se traduce a 65 cm, dos pantallas, 6 h/día y luz ambiental variable. Se registra tolerancia declarada a gafas, halos y posible compromiso de lejos. Estas variables permiten interpretar heterogeneidad y no deben usarse después para inventar subgrupos favorables.
2.2. Dominio de eficacia visual
Sección titulada «2.2. Dominio de eficacia visual»Como mínimo: agudeza monocular y binocular lejos, intermedio y cerca; sin corrección y con la corrección pertinente; refracción posoperatoria cuando procede; y curva de desenfoque binocular para ópticas con rango extendido. Se declara optotipo, luminancia, contraste, distancia, notación, corrección y regla de puntuación.
La agudeza intermedia se mide a una distancia nominal y real. Los 66 cm representan 1,50 D y 80 cm 1,25 D, pero una persona puede trabajar a 55 cm. La agudeza próxima a 40 cm representa 2,50 D; cambiar distancia durante el test altera demanda y tamaño angular. Debe registrarse, no corregirse en silencio.
2.3. Dominio funcional
Sección titulada «2.3. Dominio funcional»Incluye lectura continua —agudeza, velocidad y tamaño crítico—, contraste fotópico y mesópico, glare cuando sea pertinente, alternancia entre distancias y tarea real o simulada. Se añade un PROM de función próxima/impacto y otro de calidad visual si la intervención puede generar fenómenos.
La prueba funcional debe concordar con el objetivo. Un trabajador de precisión necesita error y tiempo; un conductor, contraste y alternancia tablero-lejos; un lector, velocidad sostenida y comprensión. Un único panel no sirve para todas las decisiones, pero el núcleo permite comparar.
2.4. Dominio de seguridad y rescate
Sección titulada «2.4. Dominio de seguridad y rescate»Se registran todos los eventos adversos con definición, gravedad, lateralidad, comienzo, resolución y atribución; pérdida de líneas corregidas; infección, inflamación, presión, defecto epitelial, haze, descentramiento, edema, complicación retiniana y otros riesgos propios del procedimiento.
También se cuentan eventos que a menudo desaparecen del resumen: retirada de lente de contacto, intolerancia, interrupción de fármaco, gafas nuevas, láser complementario, intercambio/rotación de LIO, explante, YAG y reintervención. El rescate puede ser un desenlace clínico y un evento intercurrente que cambia cómo interpretar eficacia.
2.5. Satisfacción y concordancia con la meta
Sección titulada «2.5. Satisfacción y concordancia con la meta»Satisfacción global es útil, pero depende de expectativa, relación clínica, coste y respuesta adaptativa. Se pregunta por distancia y contexto, disposición a elegir de nuevo y cumplimiento de metas preespecificadas. «Satisfecho» junto a uso constante de gafas puede ser éxito si esa era la meta; «independiente» con halos incapacitantes puede no serlo.
La proporción que alcanza su meta individual debe acompañarse de definición previa y verificación. No se permite redefinir la meta tras conocer el resultado. En investigación, las metas se agrupan mediante categorías reproducibles sin perder el dato individual.
3. Agudeza visual: protocolizar lo aparentemente simple
Sección titulada «3. Agudeza visual: protocolizar lo aparentemente simple»La agudeza cambia con optotipo, número de letras, iluminación, contraste, distancia, refracción, ojo, binocularidad y criterio de terminación. «20/20» sin protocolo es un resumen incompleto. LogMAR con puntuación letra a letra facilita análisis continuo; Snellen es comprensible, pero sus intervalos no son lineales.
Se evita tratar ambos ojos de una persona como observaciones independientes sin un modelo que reconozca correlación. Si la intervención es bilateral, la función binocular suele ser el desenlace clínico principal, pero seguridad y agudeza corregida deben conservarse por ojo.
3.1. Sin corrección, corregida y habitual
Sección titulada «3.1. Sin corrección, corregida y habitual»La visión sin corrección informa independencia óptica; la mejor corregida detecta potencial y pérdida; la habitual muestra vida real. No son intercambiables. Una LIO puede producir buena binocular sin corrección y mantener un error monocular; una gafa puede dar excelente corregida y no usarse por ergonomía.
En ensayos, debe declararse si la refracción se optimizó antes de contraste, lectura o curva. Comparar una tecnología corregida con otra no corregida confunde óptica y error residual. El astigmatismo se informa por magnitud y eje o análisis vectorial cuando proceda.
3.2. Distancia fija y distancia preferida
Sección titulada «3.2. Distancia fija y distancia preferida»La distancia fija estandariza; la preferida aproxima conducta. Conviene medir ambas cuando la pregunta lo exige. La primera permite comparar; la segunda revela compensación al acercar, alejar, aumentar luz o tamaño. Si se usa distancia preferida, se registra en centímetros.
El tamaño de letra debe expresarse con una notación reproducible y distancia. Jaeger no es uniforme entre cartas. Una equivalencia aparente puede ser falsa por tipografía o geometría.
4. Curva de desenfoque: mapa óptico, no biografía visual
Sección titulada «4. Curva de desenfoque: mapa óptico, no biografía visual»La curva añade lentes positivas o negativas a la corrección de lejos y mide agudeza a cada desenfoque. Estima tolerancia óptica a diferentes demandas, pero no coloca físicamente el objeto a cada distancia, no reproduce cambio de tamaño angular, disparidad, convergencia, acomodación residual, luz cotidiana ni tarea continua.
Pupila, contraste, desenfoque esférico o cilíndrico, distancia del optotipo, medición mono/binocular, carta, rango, paso y análisis modifican la curva [2]. Por ello, dos perfiles no se comparan por una figura sin revisar método.
4.1. Protocolo mínimo
Sección titulada «4.1. Protocolo mínimo»Se declara:
- refracción de partida y corrección del cilindro;
- distancia y luminancia del optotipo;
- tipo de carta y puntuación;
- ojo o binocularidad;
- rango dióptrico y orden de presentación;
- paso, habitualmente 0,50 D o más fino si se justifica;
- tiempo/adaptación por punto y criterio de finalización;
- pupila o condición luminosa;
- repetición y enmascaramiento del examinador cuando sea posible.
Presentar siempre de positivo a negativo puede introducir aprendizaje o fatiga. La aleatorización o un orden definido y constante reduce ambigüedad. El rango positivo informa tolerancia a hipermetropización y debe interpretarse con cautela.
4.2. Resumen de la curva
Sección titulada «4.2. Resumen de la curva»Una línea a un umbral —por ejemplo 0,2 logMAR— permite definir rango funcional, pero el umbral debe preespecificarse. El área bajo la curva resume rendimiento y puede ocultar valles relevantes. La comparación punto a punto multiplica pruebas. Se presenta curva completa con intervalos y una métrica primaria predefinida.
Una diferencia de 0,05 logMAR en varios puntos puede alcanzar significación con gran muestra y carecer de relevancia perceptible. A la inversa, un valle intermedio estrecho puede ser importante en una tarea aun sin alcanzar significación corregida. La interpretación combina magnitud, precisión y contexto.
4.3. Curva y acomodación
Sección titulada «4.3. Curva y acomodación»En fáquicos con tratamiento farmacológico o corneal, la curva no demuestra restauración biomecánica de acomodación. Profundidad de foco, miosis, aberración, pseudoacomodación y estrategia binocular pueden mejorarla. Para afirmar acomodación se necesitan medidas dinámicas/objetivas apropiadas y coherencia con estímulo-respuesta.
En LIO, una curva amplia describe rango de visión, no movimiento del implante salvo demostración independiente. El lenguaje separa «rango funcional de foco» de «amplitud acomodativa».
5. Lectura: del optotipo a la información
Sección titulada «5. Lectura: del optotipo a la información»Leer implica reconocimiento secuencial, sacadas, velocidad, comprensión y resistencia. Las cartas históricas de cerca no son equivalentes; las familias Bailey–Lovie, Colenbrander, MNREAD y RADNER intentan estandarizar texto y métricas [3]. Debe usarse una versión lingüística apropiada y respetar licencias.
Se registran agudeza de lectura, velocidad máxima, tamaño crítico, distancia y corrección. Una persona puede descifrar letra pequeña lentamente y no sostener un capítulo; otra puede preferir tamaño mayor con velocidad estable. La agudeza aislada no captura ese contraste.
5.1. Idioma, alfabetización y aprendizaje
Sección titulada «5.1. Idioma, alfabetización y aprendizaje»La velocidad depende de idioma, escolaridad, familiaridad, contenido y lectura oral/silenciosa. Las frases paralelas deben estar equilibradas; repetir el mismo texto produce aprendizaje. No se compara directamente una velocidad española con una portuguesa sin validar equivalencia.
Si el paciente no domina el idioma del test, el resultado mezcla visión y lenguaje. Se documenta y se elige una tarea funcional alternativa, evitando excluir sin explicación.
5.2. Condiciones reales
Sección titulada «5.2. Condiciones reales»Se añade texto habitual —móvil, etiqueta, partitura— con tamaño medido, contraste, luz y duración. No sustituye la prueba estándar; la complementa. La lectura sostenida puede revelar sequedad, pérdida de línea, disminución de velocidad o necesidad de luz que una frase no muestra.
Se registra comprensión o error cuando importa. Leer rápido sin entender no es éxito funcional. Para medicamentos o seguridad, el error crítico puede ser más relevante que palabras por minuto.
6. Contraste, glare y pupilometría
Sección titulada «6. Contraste, glare y pupilometría»La sensibilidad al contraste representa un rango de frecuencias, no una sola «agudeza de bajo contraste». Deben declararse carta/dispositivo, luminancia, frecuencia, corrección, monocular/binocular y presencia de glare. Fotópico y mesópico responden a contextos diferentes.
El efecto de una óptica multifocal puede ser pequeño con alto contraste y mayor bajo luz reducida. El promedio puede ocultar una cola de malos respondedores. Se presentan distribución, cambio y proporción que cruza umbral clínicamente relevante cuando existe.
6.1. Glare y fenómenos fóticos
Sección titulada «6.1. Glare y fenómenos fóticos»Glare disability objetivo, halos en simulador y molestia referida son constructos distintos. Se define fuente, ángulo, luminancia, adaptación y desenlace. La imagen de un halo no debe convertirse sin validación en intensidad clínica.
La anamnesis distingue presencia, frecuencia, intensidad, molestia, tarea y cambio temporal. Un halo frecuente pero no molesto difiere de uno raro que impide conducir. El instrumento QoV formaliza esta separación.
6.2. Pupila como variable de contexto
Sección titulada «6.2. Pupila como variable de contexto»La pupila se mide bajo luminancia definida y, si es relevante, dinámica. Un diámetro único de topógrafo no representa noche. Se documentan fármacos, edad, iris y latencia. La pupila puede modificar rendimiento de inlays, ablaciones, LIO y mióticos, pero rara vez actúa como selector absoluto por sí sola.
El análisis por tamaño pupilar debe preespecificarse o declararse exploratorio. Buscar después el punto de corte que maximiza una diferencia infla optimismo.
7. Independencia de gafas: definir el desenlace más publicitado
Sección titulada «7. Independencia de gafas: definir el desenlace más publicitado»«Independencia» puede significar nunca usar gafas, no necesitarlas la mayor parte del tiempo, no llevarlas para cerca o no desearlas pese a tenerlas. Se pregunta por lejos, intermedio y cerca, frecuencia, tarea, luz y periodo de recuerdo.
Una escala útil distingue nunca, ocasional, parte del tiempo, mayor parte y siempre; además pregunta si el uso es voluntario o necesario. La independencia bilateral no se infiere de agudeza monocular. Se informa proporción y distribución, no solo media.
7.1. Corrección de rescate
Sección titulada «7.1. Corrección de rescate»Una gafa de letra pequeña, conducción nocturna o trabajo fino no equivale a fracaso si fue anticipada. Debe contarse y describirse. Si el ensayo define éxito como «no usa gafas», entregar una gafa pero no preguntar por uso introduce sesgo.
El rescate farmacológico, óptico o quirúrgico modifica la interpretación. El análisis debe decidir antes si atribuye resultados posteriores a la estrategia original, al estado sin rescate o a un compuesto de fracaso/rescate.
7.2. Expectativa y coste
Sección titulada «7.2. Expectativa y coste»Quien pagó por independencia puede declarar satisfacción o decepción de modo diferente. Se recoge expectativa basal y, cuando se comparan modelos de financiación, posible influencia. Satisfacción no se descarta, pero se triangula con función y daño.
8. PROM: medir la voz del paciente sin improvisarla
Sección titulada «8. PROM: medir la voz del paciente sin improvisarla»Un PROM no es una encuesta informal. Es instrumento, instrucciones, periodo de recuerdo, opciones, algoritmo y evidencia de medida. Debe responder al constructo que el paciente puede informar directamente.
El NAVQ-P adaptó el contenido a presbicia fáquica y tecnología actual mediante entrevistas en 15 participantes estadounidenses, 10 alemanes, 10 franceses y 7 profesionales; añadió tareas de precisión y alternancia lejos-cerca, y surgió la necesidad de contraste [4]. Ese trabajo establece relevancia/comprensibilidad, no automáticamente fiabilidad o respuesta al cambio.
Un estudio posterior utilizó datos de 235 adultos aleatorizados, con 227 en el análisis transversal del mes 2, y refinó una versión de 14 ítems con consistencia interna α 0,979 y fiabilidad test–retest alta [5]. Un α tan elevado no demuestra por sí solo validez ni ausencia de redundancia; la población fáquica, idiomas, tratamiento y patrocinio delimitan el uso.
8.1. PICQ
Sección titulada «8.1. PICQ»El PICQ mide impacto y estrategias de afrontamiento. Partió de 20 entrevistas de elicitación, 20 debriefings y 151 participantes para psicometría; generó dos dominios 0–4, con α 0,89/0,84, ICC 0,77/0,67 y umbral de cambio individual −1,00 [6]. El valor es específico del instrumento, puntuación, contexto y análisis; no se transfiere a otro PROM.
El dominio de afrontamiento es clínicamente interesante: aumentar luz, alejar texto o usar móvil puede mantener actividad mientras oculta pérdida óptica. Reducir afrontamiento podría ser beneficio aun con cambio modesto de agudeza.
8.2. Quality of Vision
Sección titulada «8.2. Quality of Vision»QoV contiene 30 ítems: 10 síntomas valorados por frecuencia, intensidad y molestia, con escalado Rasch y mínimo ICC 0,867 en su desarrollo [7]. Permite no reducir halos/glare a presente/ausente. No es específico de presbicia y puede necesitar licencia, versión y modo autorizados.
Un perfil de frecuencia, intensidad y molestia es más informativo que una puntuación total cuando una tarea crítica domina. El análisis puede preespecificar dominio primario y conservar ítems relevantes sin selección oportunista.
8.3. Selección apta para propósito
Sección titulada «8.3. Selección apta para propósito»COSMIN v2.0 exige pregunta bien definida, búsqueda, riesgo de sesgo, propiedades de medida, síntesis y certeza [8]. Para seleccionar un PROM se revisan contenido, estructura, consistencia, fiabilidad, error, validez, respuesta y equivalencia transcultural. La practicidad no compensa medir el constructo equivocado.
La FDA recuerda que la evidencia debe sostener el contexto de uso del instrumento: población, intervención, beneficio reclamado, idioma, modo y momento [9]. «Validado» no es un sello universal. Una traducción correcta lingüísticamente puede requerir debriefing y psicometría; un formulario en papel no es automáticamente equivalente a app.
8.4. Cambio importante y respuesta
Sección titulada «8.4. Cambio importante y respuesta»La diferencia mínimamente importante no se deduce solo de desviaciones estándar. Se triangulan anclas comprensibles, distribución, error y consecuencias. El umbral individual y la diferencia media entre grupos no son lo mismo.
El efecto techo impide detectar mejora en sujetos poco afectados; el suelo impide mostrar empeoramiento. El targeting de Rasch indica si dificultad de ítems cubre capacidad de la muestra. Un instrumento preciso en presbicia moderada puede no discriminar inicio temprano o pseudofaquia compleja.
9. El ensayo aleatorizado: diseño antes que etiqueta
Sección titulada «9. El ensayo aleatorizado: diseño antes que etiqueta»La aleatorización equilibra en expectativa factores conocidos y desconocidos, pero no corrige mala medición, pérdidas, falta de adherencia, reporte selectivo o análisis inapropiado. En cirugía y dispositivos, cegamiento de operador es difícil; se puede cegar evaluador, estandarizar entusiasmo y usar resultados objetivos/centralizados.
CONSORT 2025 establece 30 ítems e integra registro, protocolo y plan estadístico accesibles, datos, financiación/conflictos, medición de daños, intervención/comparador, datos disponibles y cambios tras inicio [10]. Cumplir el reporte facilita crítica; no garantiza que el diseño haya sido correcto.
SPIRIT 2025 lleva esa transparencia al protocolo y alinea prespecificación con el informe final [11]. Comparar registro, protocolo, SAP, publicación y resultados del registro permite detectar desenlaces cambiados, tiempos omitidos y análisis post hoc.
9.1. Unidad de aleatorización y análisis
Sección titulada «9.1. Unidad de aleatorización y análisis»Si se aleatoriza persona y se tratan ambos ojos, la persona es la unidad para PROM y muchos desenlaces binoculares. Analizar 200 ojos como 200 independientes cuando pertenecen a 100 personas estrecha intervalos de forma artificial. Diseños intraindividuales necesitan considerar carry-over binocular, dominancia y dependencia.
La intervención del primer ojo puede condicionar elección del segundo. En mix-and-match, el efecto es del sistema bilateral, no de una lente aislada. Se describe secuencia y ventana entre ojos.
9.2. Comparador pertinente
Sección titulada «9.2. Comparador pertinente»Comparar una tecnología nueva con monofocal sin oferta de gafas puede exagerar independencia; compararla solo con un modelo obsoleto limita relevancia. El comparador debe representar atención razonable y la pregunta del paciente.
El enmascaramiento puede romperse por halos o miosis. Se mide si participantes/evaluadores adivinan grupo cuando es importante, sin suponer que una etiqueta «doble ciego» resolvió todo.
10. Estimandos, pérdidas y eventos intercurrentes
Sección titulada «10. Estimandos, pérdidas y eventos intercurrentes»ICH E9(R1) obliga a definir qué efecto se quiere estimar y qué hacer con eventos que ocurren después de asignar tratamiento: abandono, no adherencia, rescate, cirugía contralateral, intercambio, YAG o complicación [12]. El estimando especifica población, variable, tratamiento, manejo de eventos y resumen.
Una estrategia de política de tratamiento responde qué ocurre al asignar la intervención aunque haya rescate. Una estrategia hipotética pregunta qué habría ocurrido sin el evento. Una estrategia compuesta puede considerar el rescate fracaso. Ninguna es siempre superior; debe corresponder a la decisión.
10.1. Datos ausentes
Sección titulada «10.1. Datos ausentes»Las pérdidas no son solo porcentaje. Se informa por grupo, motivo, momento y relación posible con resultado. Quien abandona por halos no se parece a una pérdida administrativa. La imputación de último valor puede ser inverosímil en adaptación o regresión.
El análisis principal y sensibilidad exploran supuestos. Un resultado robusto a escenarios plausibles merece más confianza. El análisis completo de casos no es neutral si la ausencia depende de visión o satisfacción.
10.2. Multiplicidad
Sección titulada «10.2. Multiplicidad»Tres distancias, muchos puntos de curva, varios tiempos, ojos y PROM producen decenas de pruebas. Se define un desenlace primario y se controla error cuando se hacen afirmaciones confirmatorias múltiples. El resto puede ser exploratorio con intervalos y lenguaje prudente.
Seleccionar después el tiempo o punto más favorable es multiplicidad oculta. Una figura completa y acceso a protocolo reducen esta práctica.
11. Superioridad, no inferioridad y equivalencia
Sección titulada «11. Superioridad, no inferioridad y equivalencia»Un ensayo de superioridad busca diferencia. Si no la encuentra, puede estar impreciso; no demuestra igualdad. La no inferioridad pregunta si la nueva opción no es peor que un control por más de un margen clínicamente aceptable, quizá a cambio de reversibilidad, menor coste o menos daño.
La extensión CONSORT exige declarar y justificar margen, hipótesis y análisis [13]. El margen no se elige para facilitar éxito y debe preservar una fracción razonable del beneficio del control. Se muestran intervalo de confianza y relación con cero y margen.
11.1. Intención de tratar y por protocolo
Sección titulada «11.1. Intención de tratar y por protocolo»En superioridad, intención de tratar suele proteger aleatorización. En no inferioridad, desviaciones y cruces pueden acercar grupos y favorecer una conclusión falsa; por eso se examinan análisis de intención y por protocolo, junto con sensibilidad y estimando.
Que ambos análisis coincidan aumenta confianza, pero no repara un margen injustificado o control que no funcionó. Debe existir sensibilidad del ensayo para distinguir un tratamiento eficaz de uno ineficaz.
11.2. Magnitud y precisión
Sección titulada «11.2. Magnitud y precisión»La afirmación se basa en intervalo, no solo P. Un intervalo que excluye el margen pero también demuestra una pequeña inferioridad puede permitir no inferioridad sin equivalencia clínica. El lenguaje debe mostrar esa posibilidad.
Una diferencia estadística de una letra puede carecer de valor; una diferencia de halos que afecta conducción puede importar aunque el promedio sea modesto. El juicio clínico se preespecifica con umbrales y preferencias.
12. Registro, transparencia, financiación y conflictos
Sección titulada «12. Registro, transparencia, financiación y conflictos»El registro prospectivo crea una huella antes de resultados. ClinicalTrials.gov resume obligaciones y políticas vinculadas a FDAAA, NIH, WHO e ICMJE [14]. No todos los estudios comparten obligación jurídica, pero todo ensayo confirmatorio debería registrar protocolo, desenlaces, tiempos y análisis.
Se compara fecha de registro con primer participante. Registro retrospectivo no recupera prespecificación. Resultados publicados y tabulados en registro pueden diferir; la discrepancia se explica, no se elige el más favorable.
12.1. Financiación
Sección titulada «12.1. Financiación»La industria aporta desarrollo y datos, y el conflicto no invalida automáticamente. Se revisan papel del patrocinador, propiedad de datos, escritura, análisis independiente, acceso al protocolo y publicación de resultados desfavorables.
También existen conflictos académicos, quirúrgicos e intelectuales. La ausencia de declaración no demuestra ausencia. La respuesta es transparencia y replicación, no descalificación ad hominem.
12.2. Daños y denominadores
Sección titulada «12.2. Daños y denominadores»Los daños se buscan sistemáticamente y con el mismo rigor entre grupos. Se informa número de participantes afectados, eventos, gravedad, tiempo y denominador expuesto. «No hubo eventos significativos» no sustituye tabla.
En procedimientos bilaterales, se distingue paciente, ojo y evento. Una persona con dos halos no son dos pacientes. Eventos raros necesitan muestras grandes y vigilancia poscomercialización.
13. Datos observacionales y práctica real
Sección titulada «13. Datos observacionales y práctica real»Los registros aportan tamaño, diversidad, aprendizaje, durabilidad y eventos raros. Pero selección de tecnología se relaciona con edad, retina, córnea, recursos, cirujano y expectativas. Comparar resultados brutos confunde indicación con efecto.
RoB 2 evalúa un resultado específico de ensayo; ROBINS-I formula un ensayo diana para estudiar sesgo en no aleatorizados [15]. La herramienta apropiada depende del diseño. Una puntuación total de «calidad» oculta dominios y no sustituye razonamiento causal.
13.1. Confusión y selección
Sección titulada «13.1. Confusión y selección»Se define tiempo cero, elegibilidad, intervención, comparador y seguimiento como en el ensayo diana. Incluir solo quienes completaron adaptación produce supervivencia del tolerante. Excluir intercambios del grupo original elimina fracasos.
Propensity score o ajuste multivariable solo controlan variables medidas correctamente. Un gran registro no corrige preferencia o habilidad del cirujano no registradas. Se presentan análisis de sensibilidad y controles negativos cuando son posibles.
13.2. Curva de aprendizaje y centro
Sección titulada «13.2. Curva de aprendizaje y centro»La tecnología nueva puede mejorar con experiencia o parecer mejor en centros expertos. Se registra cirujano, centro, volumen, fecha y modificaciones. La generalización requiere contextos más allá del desarrollador.
Los datos reales complementan, no reemplazan, comparaciones robustas. Son especialmente valiosos para explante, retoque, YAG, pérdida de seguimiento y uso de gafas a años.
14. Revisiones sistemáticas y metaanálisis
Sección titulada «14. Revisiones sistemáticas y metaanálisis»PRISMA 2020 contiene 27 ítems para reportar una revisión y no debe usarse como herramienta de calidad metodológica [16]. Una revisión bien escrita puede incluir estudios sesgados; una búsqueda incompletamente descrita puede ocultar selección. Se revisan protocolo, bases, fecha, estrategias, duplicación, extracción y riesgo de sesgo.
La síntesis requiere suficiente similitud clínica y metodológica. Agrupar bifocales, trifocales, EDOF, acomodativas e inlays como «multifocal» puede responder una pregunta demasiado amplia. La heterogeneidad no se resuelve solo con modelo de efectos aleatorios.
14.1. Efecto relativo y absoluto
Sección titulada «14.1. Efecto relativo y absoluto»El riesgo relativo puede ser estable y el beneficio absoluto depender del riesgo basal. Se presentan ambos. Un RR de halos no dice cuántas personas adicionales los experimentan sin tasa de control.
Las diferencias medias estandarizadas facilitan combinar escalas, pero pierden unidades clínicas. Si se mezclan PROM distintos, debe comprobarse que miden el mismo constructo y dirección.
14.2. Sesgo de publicación y duplicación
Sección titulada «14.2. Sesgo de publicación y duplicación»Los estudios pequeños positivos se publican más. Dispositivos cambian nombre o versión y una cohorte puede aparecer en varios artículos. Se comparan centros, fechas, tamaños y registro para evitar doble conteo.
Un funnel plot con pocos estudios no diagnostica ausencia de sesgo. Se buscan registros, resultados regulatorios, actas y contactos; se comunica incertidumbre.
15. Comparaciones directas y metaanálisis en red
Sección titulada «15. Comparaciones directas y metaanálisis en red»La comparación directa aleatorizada entre A y B es preferible para esa pregunta cuando existe y es aplicable. Una red combina A–B y B–C para inferir A–C. La ganancia de precisión depende de que las comparaciones sean intercambiables.
CINeMA estructura seis dominios de confianza y recuerda que transividad/coherencia son esenciales [17]. Edad, catarata, error residual permitido, bilateralidad, seguimiento, generación de dispositivo y definición de éxito pueden modificar efecto y romper la inferencia indirecta.
15.1. Ranking no es recomendación
Sección titulada «15.1. Ranking no es recomendación»SUCRA o probabilidad de ser primero puede sobreinterpretarse con diferencias mínimas e incertidumbre grande. Se presentan efectos relativos con intervalos y certeza, no solo posiciones. Un tratamiento puede rankear alto en cerca y bajo en halos o seguridad.
La mejor opción depende de desenlace prioritario. Un ranking compuesto requiere pesos transparentes y preferencias. La red no conoce cuánto valora una persona conducir de noche frente a leer sin gafas.
15.2. Generaciones tecnológicas
Sección titulada «15.2. Generaciones tecnológicas»Una lente con el mismo nombre comercial puede cambiar; comparadores antiguos pueden crear ventaja. Se identifica modelo, potencia, adición, material, plataforma, fecha y técnica. El supuesto de clase debe justificarse ópticamente y clínicamente.
Las redes se vuelven obsoletas al entrar tecnologías. Una revisión viva puede ser útil si mantiene protocolo y gobernanza, no si incorpora selectivamente novedades.
16. Certeza GRADE por desenlace
Sección titulada «16. Certeza GRADE por desenlace»GRADE juzga certeza por resultado mediante riesgo de sesgo, inconsistencia, indirectitud, imprecisión y sesgo de publicación [18]. No asigna una nota única a la tecnología. La certeza de agudeza puede ser moderada y la de explante a 5 años muy baja.
«Baja certeza» no significa que no exista efecto; significa que la estimación puede cambiar de forma importante. «Alta» no significa beneficio grande o decisión correcta: solo confianza alta en la estimación para esa pregunta.
16.1. Indirectitud
Sección titulada «16.1. Indirectitud»Un ensayo en présbitas fáquicos sanos de 48 años puede ser indirecto para pseudofáquicos con retina límite. Una curva a 1 mes es indirecta para conducción nocturna a 2 años. Un comparador placebo puede no responder frente a gafas optimizadas.
Se especifica la ruta de indirectitud: población, intervención, comparador o desenlace. Decir «evidencia limitada» sin motivo no orienta investigación.
16.2. Imprecisión y rareza
Sección titulada «16.2. Imprecisión y rareza»Un intervalo que abarca beneficio y daño clínicamente importantes exige bajar certeza aunque P sea menor de 0,05. Para eventos raros, cero eventos en muestra pequeña no demuestra seguridad. Se informa límite compatible.
La revisión Cochrane de cirugía de presbicia de 2025 encontró 4 estudios, 300 participantes/600 ojos, una sola fuente por comparación, seguimiento de 3–6 meses, ningún resultado a 12 meses ni economía y certeza baja/muy baja [19]. El ejemplo muestra que abundancia tecnológica no equivale a evidencia comparativa madura.
17. Marco PECO: del dato al uso responsable
Sección titulada «17. Marco PECO: del dato al uso responsable»PECO se utiliza aquí como Predicción, Exploración, Confirmación y Optimización, no como acrónimo clásico de pregunta epidemiológica. Cada análisis recibe una etiqueta antes de ejecutarse.
17.1. Predicción
Sección titulada «17.1. Predicción»Un modelo predice beneficio, halos, error refractivo o necesidad de rescate en individuos nuevos. Necesita desarrollo separado de validación, calibración, discriminación, manejo de ausentes y utilidad clínica. Una asociación significativa no basta.
La validación externa debe representar centro, población y generación tecnológica de destino. Recalibrar puede ser necesario. El modelo no se usa como veto opaco y se monitoriza después de implantación.
17.2. Exploración
Sección titulada «17.2. Exploración»La exploración descubre patrones y genera hipótesis: pupila, ángulo kappa, aberración, dominancia o personalidad. Se permite flexibilidad, pero se declara. Los puntos de corte nacidos del mismo conjunto son provisionales.
La multiplicidad y sobreajuste se hacen visibles. Un hallazgo de subgrupo sin interacción preespecificada no se convierte en regla de selección.
17.3. Confirmación
Sección titulada «17.3. Confirmación»Confirma una hipótesis, desenlace, estimando, margen y análisis preespecificados. Requiere comparador, tamaño, registro y control de error. La replicación independiente aumenta credibilidad.
Si falla, no se rescata cambiando población, tiempo o desenlace sin etiquetar el nuevo análisis como exploratorio. Un resultado negativo bien diseñado informa tanto como uno positivo.
17.4. Optimización
Sección titulada «17.4. Optimización»Optimizar ajusta técnica, centrado, potencia, bilateralidad, secuencia o selección. Puede usar diseños adaptativos o aprendizaje continuo con límites de seguridad. Debe evitar que cada iteración borre los fracasos anteriores.
La versión del dispositivo y del algoritmo se congela para evaluar. Después se documenta cambio y nueva validación. El «aprendizaje» no justifica una intervención irreversible fuera de evidencia o consentimiento.
18. Interpretación clínica integrada
Sección titulada «18. Interpretación clínica integrada»Una tabla de evidencia útil tiene filas por desenlace y columnas para población, intervención/comparador, instrumento/protocolo, momento, efecto absoluto/relativo, precisión, sesgo, certeza y aplicabilidad. A continuación se añade la meta del paciente.
La decisión se formula así: «en personas similares, con este protocolo, la intervención probablemente mejora X en esta magnitud; puede empeorar Y; la certeza es Z; no sabemos A a largo plazo; para su tarea B, la evidencia es indirecta». Esta frase es más honesta y accionable que «la lente tiene excelentes resultados».
18.1. Triangulación
Sección titulada «18.1. Triangulación»La confianza aumenta cuando agudeza, lectura, PROM y tarea apuntan en la misma dirección. La discordancia se investiga: buena agudeza/mala función puede indicar contraste, superficie, binocularidad o expectativa; mal test/buena vida puede reflejar adaptación o irrelevancia del test.
No se promedia la discordancia hasta hacerla desaparecer. Puede revelar el mecanismo que determina satisfacción.
18.2. Comunicación de incertidumbre
Sección titulada «18.2. Comunicación de incertidumbre»Se usan frecuencias absolutas y rangos. Se distingue «no se observó» de «se demostró ausencia». Se nombra seguimiento máximo y pérdida. Para daños irreversibles, el umbral de evidencia y consentimiento es mayor.
El paciente puede elegir una opción menos eficaz en promedio por reversibilidad o una más independiente aceptando halos. La decisión informada no exige preferir el ranking, sino comprender consecuencias.
19. Propuesta de ficha mínima para estudios y registros
Sección titulada «19. Propuesta de ficha mínima para estudios y registros»Todo estudio de corrección de presbicia debería publicar o depositar:
- protocolo, registro, SAP y versión de intervención;
- flujo de participantes, ojos y razones de pérdida;
- baseline clínico, funcional, tareas y metas;
- refracción y agudeza mono/binocular con protocolo;
- intermedio/cerca a distancias declaradas;
- curva completa con protocolo y datos de precisión;
- lectura estandarizada y tarea real pertinente;
- contraste/glare/pupila cuando la óptica lo justifique;
- PROM apto para propósito y versión/idioma;
- independencia por distancia, frecuencia y rescate;
- daños, líneas perdidas, explantes, retoques y reintervenciones;
- resultados en tiempos corto, medio y largo;
- efecto, intervalo, ausentes y sensibilidad;
- financiación, conflictos, acceso a datos/código; y
- concordancia con meta individual.
Un registro clínico puede usar un núcleo más breve y módulos. Lo esencial es mantener definiciones estables y permitir auditoría. La carga de datos se reduce integrando captura en consulta y evitando cuestionarios redundantes.
20. Puntos clave
Sección titulada «20. Puntos clave»- «Funciona» debe descomponerse en constructo, variable, métrica, agregación y tiempo.
- El conjunto mínimo combina agudeza, refracción, función, PROM, seguridad, rescate y meta individual.
- La curva de desenfoque depende del protocolo y no reproduce lectura ni tarea real.
- Lectura exige texto estandarizado, velocidad, tamaño crítico, distancia e idioma adecuado.
- Contraste, glare objetivo, fenómeno referido y pupila son constructos relacionados pero distintos.
- Independencia de gafas se define por distancia, frecuencia, contexto y rescate.
- Un PROM es apto para un propósito concreto; traducido o validado no significa universal.
- Consistencia interna no demuestra validez, respuesta al cambio ni utilidad clínica.
- Aleatorización no elimina sesgo por pérdidas, medición, multiplicidad o reporte selectivo.
- Ausencia de significación no prueba equivalencia; no inferioridad necesita margen justificado.
- Registro, protocolo, SAP y resultados permiten detectar cambios y omisiones.
- Los datos observacionales aportan durabilidad/rareza, pero exigen ensayo diana y control de confusión.
- PRISMA y CONSORT mejoran reporte; no son puntuaciones automáticas de calidad.
- Una red requiere transividad/coherencia; su ranking no elige por el paciente.
- GRADE se aplica por desenlace y expresa confianza, no tamaño del beneficio.
- PECO separa predicción, exploración, confirmación y optimización para limitar exageración.
21. Controversias
Sección titulada «21. Controversias»21.1. ¿Un core set puede frenar innovación?
Sección titulada «21.1. ¿Un core set puede frenar innovación?»Un núcleo no prohíbe desenlaces nuevos; obliga a conservar comparabilidad. La innovación debe añadir, no reemplazar selectivamente, medidas comunes. Si una tecnología requiere un constructo nuevo, este se define y valida.
21.2. ¿Qué umbral define visión funcional?
Sección titulada «21.2. ¿Qué umbral define visión funcional?»0,3, 0,2 o 0,1 logMAR responden a tareas diferentes. Un umbral universal simplifica y puede deformar. Conviene presentar curva continua y rangos a umbrales preespecificados, vinculados a tarea.
21.3. ¿Satisfacción o rendimiento?
Sección titulada «21.3. ¿Satisfacción o rendimiento?»Ambos. La satisfacción sin seguridad es insuficiente; el rendimiento excelente no obliga a aceptar síntomas. Su discordancia es información, no ruido.
21.4. ¿Puede la industria liderar validación?
Sección titulada «21.4. ¿Puede la industria liderar validación?»Puede financiar desarrollo riguroso, pero la confianza aumenta con protocolo público, acceso, análisis independiente y replicación en poblaciones/tecnologías distintas. El conflicto se gestiona, no se oculta ni se usa como sustituto de crítica.
21.5. ¿Metaanálisis de clase o por modelo?
Sección titulada «21.5. ¿Metaanálisis de clase o por modelo?»La clase aumenta potencia y puede mezclar mecanismos. El modelo conserva especificidad y puede quedar impreciso. La decisión se justifica por similitud óptica, versión, efecto modificador y pregunta; se hacen análisis de sensibilidad.
22. Lagunas del conocimiento
Sección titulada «22. Lagunas del conocimiento»No existe todavía un conjunto internacional específico aceptado que abarque toda presbicia y todas las intervenciones. Faltan valores de cambio importante y versiones lingüísticas comparables para varios PROM; consenso de distancia/luminancia para curva, lectura y contraste; y taxonomía uniforme de halos, glare, starburst y disfotopsia.
Los ensayos comparativos suelen ser pequeños, cortos y heterogéneos. Faltan comparadores contemporáneos, datos a 5–10 años, resultados de segundo ojo, explante/retoque, progresión del cristalino, tarea crítica, inequidad y coste. Los registros deben enlazar versión de dispositivo, cirujano, rescates y PRO.
La inteligencia artificial puede predecir selección o resultado, pero necesita validación externa, calibración, auditoría de subgrupos, gobernanza y evaluación de utilidad. Se requieren estudios que demuestren que usar el modelo mejora decisiones, no solo AUC.
23. Líneas de investigación prioritarias
Sección titulada «23. Líneas de investigación prioritarias»- Delphi internacional con pacientes para un core outcome set de presbicia.
- Consenso abierto de protocolos para agudeza, curva, lectura, contraste, glare y pupila.
- Valores de cambio importante por PROM, idioma, población e intervención.
- Ensayos pragmáticos con comparadores contemporáneos y metas individuales.
- Seguimiento de 5–10 años y enlace con registros regulatorios.
- Taxonomía y conjunto mínimo de daños, rescates y reintervenciones.
- Metaanálisis de datos individuales para modificadores preespecificados.
- Redes que incorporen generación tecnológica y no solo clase comercial.
- Modelos predictivos con validación externa, calibración y análisis de decisión.
- Diseños de preferencia y decisiones multicriterio con participación del paciente.
- Resultados de conducción, trabajo, lectura sostenida y tareas ecológicas.
- Datos abiertos/código y auditorías independientes con privacidad.
Bibliografía
Sección titulada «Bibliografía»- Mahmud I, Kelley T, Stowell C, et al. A proposed minimum standard set of outcome measures for cataract surgery. JAMA Ophthalmol. 2015;133(11):1247-1252.
- Kohnen T, Lemp-Hull J, Suryakumar R. Defocus curves: focusing on factors influencing assessment. J Cataract Refract Surg. 2022;48(8):961-968.
- Radner W. Near vision examination in presbyopia patients: do we need good homologated near vision charts? Eye Vis. 2016;3:29.
- Bentley S, et al. Evaluation of the content validity of PRO instruments for phakic presbyopia, including NAVQ-P and NVCI. J Patient Rep Outcomes. 2021;5:109.
- Sims J, Sloesen B, Bentley S, Naujoks C. Psychometric evaluation of NAVQ-P and additional patient-reported outcome items. J Patient Rep Outcomes. 2024;8:41.
- Johnson N, Shirneshan E, Coon CD, et al. Development of the Presbyopia Impact and Coping Questionnaire. Ophthalmol Ther. 2021;10(4):1057-1075.
- McAlinden C, Pesudovs K, Moore JE. The development of an instrument to measure quality of vision: the Quality of Vision questionnaire. Invest Ophthalmol Vis Sci. 2010;51(11):5537-5545.
- Mokkink LB, Elsman EBM, Terwee CB. COSMIN guideline for systematic reviews of patient-reported outcome measures version 2.0. Qual Life Res. 2024;33(11):2929-2939.
- US Food and Drug Administration. Patient-Reported Outcome Measures: Use in Medical Product Development to Support Labeling Claims. 2009.
- Hopewell S, Chan AW, Collins GS, et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123.
- Chan AW, Boutron I, Hopewell S, et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ. 2025;389:e081477.
- International Council for Harmonisation. ICH E9(R1) addendum on estimands and sensitivity analysis in clinical trials.
- Piaggio G, Elbourne DR, Pocock SJ, Evans SJW, Altman DG. Reporting of noninferiority and equivalence randomized trials: extension of the CONSORT 2010 statement. JAMA. 2012;308(24):2594-2604.
- ClinicalTrials.gov. Clinical Trial Reporting Requirements.
- Cochrane. Risk of bias: RoB 2 and ROBINS-I resources.
- Page MJ, McKenzie JE, Bossuyt PM, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71.
- Nikolakopoulou A, Higgins JPT, Papakonstantinou T, et al. CINeMA: software for semiautomated assessment of the confidence in network meta-analysis. Campbell Syst Rev. 2020;16:e1080.
- Cochrane. Handbook for Systematic Reviews of Interventions. Chapter 14: completing Summary of findings tables and grading the certainty of evidence.
- Alvarado-Villacorta R, Yim TW, Hernandez-Quintela E, et al. Surgical interventions for presbyopia. Cochrane Database Syst Rev. 2025;4:CD015711.
Estado: borrador académico con fuentes verificadas en línea; pendiente de revisión experta independiente, comprobación de textos completos no abiertos, validación metodológica y edición final. No constituye una guía regulatoria ni sustituye el juicio clínico o estadístico.