De leer cajas a interpretar escenas: la IA que amplía la autonomía de personas ciegas

La accesibilidad visual entró en una nueva etapa: las apps ya no solo leen textos o identifican objetos, también describen escenas, interpretan imágenes y permiten hacer preguntas en lenguaje natural. El avance promete más autonomía, aunque todavía convive con límites de conectividad, hardware y diseño digital.

“Quien no ve no carece de ideas, carece de acceso”. La frase suele citarse en debates sobre discapacidad y resume con precisión el giro que está viviendo la accesibilidad visual: durante años, leer una caja de remedios o un prospecto fue una tarea imposible sin ayuda, pero la inteligencia artificial empezó a convertir esa dependencia en una experiencia mucho más autónoma.

Una persona entra a una farmacia para comprar un medicamento. Tiene dudas sobre sus características, pero como su visión está disminuida, no puede leer lo que dice la caja y mucho menos el prospecto, escrito con una tipografía mínima. Durante mucho tiempo necesitó la colaboración de otra persona para acceder a esa información básica o resignarse a no tenerla. Hoy, en cambio, existen aplicaciones que combinan la cámara del smartphone, el lector de pantalla y la inteligencia artificial, de modo que basta apuntar el celular hacia la caja o el folleto para escuchar de qué remedio se trata, para qué sirve y qué dice el texto impreso.

Esa escena, que antes era una excepción resuelta con paciencia o apoyo externo, se repite en múltiples situaciones cotidianas: distinguir un billete, elegir ropa de un armario, saber qué hay en la heladera o identificar qué aparece en una foto. Para una persona ciega o con baja visión, acciones simples para la mayoría se transforman en desafíos cuando dependen de otro para obtener información visual. La nueva generación de asistentes con IA no solo lee: también describe, interpreta y permite preguntar sobre lo que hay frente a la cámara.

Durante años, muchas herramientas de accesibilidad visual se apoyaron en el reconocimiento óptico de caracteres (OCR), el reconocimiento de objetos y los lectores de pantalla. Esa base sigue siendo importante, pero ahora se le suman modelos capaces de procesar imagen, voz y texto al mismo tiempo. El cambio no consiste únicamente en identificar objetos o leer palabras: también permite interpretar escenas más complejas y responder consultas sobre ellas. Ya no se limita a decir “hay una caja” o “esto es una foto”; ahora puede explicar qué hay sobre una mesa, qué ropa aparece en una imagen, qué dice un cartel o cómo está distribuido un ambiente.

En ese sentido, Google integró Gemini con TalkBack, el lector de pantalla de Android, para que las personas ciegas o con baja visión no solo reciban descripciones de imágenes sin texto alternativo, sino que también puedan formular preguntas de seguimiento sobre esas imágenes y sobre toda la pantalla, con una comprensión mucho más concreta de lo que se muestra. Voceros de Google señalaron que esa evolución forma parte de un ecosistema más amplio de accesibilidad en Android, Chrome, Maps y otras herramientas. En ese marco, lanzaron StreetReaderAI, una guía virtual que analiza el entorno físico y conserva el contexto, lo que permite preguntar, por ejemplo, dónde está una parada de colectivo mientras se camina, y obtener una respuesta con la dirección y la distancia exacta.

De acuerdo con Google, todo esto se inscribe en su enfoque de Interfaces Nativamente Adaptables (NAI, por sus siglas en inglés), un modelo pensado para que la IA ayude al software a procesar voz, visión y texto de manera simultánea y, así, ajustarse a las necesidades de cada usuario. En términos más amplios, el giro tecnológico de los últimos años mostró una evolución clara: de herramientas que “traducían” texto o imágenes de manera aislada a sistemas que entienden contexto y sostienen conversaciones sobre lo que ven.

Microsoft, por su parte, desarrolló Seeing AI, una aplicación que permite leer textos, reconocer productos, describir imágenes y detectar objetos. Be My Eyes, que comenzó como una plataforma que conectaba a personas ciegas con voluntarios humanos, incorporó luego funciones de IA para describir escenas e interpretar contenido visual. Cash Reader está enfocada en la identificación de billetes. Envision, en tanto, permite leer textos, describir escenas y hacer preguntas sobre lo que muestra la cámara. Lo novedoso en todos los casos ya no es solo la herramienta puntual, sino la mejora en la capacidad de describir contextos y responder consultas en lenguaje natural.

Desde la asociación civil Tiflonexos, dedicada a mejorar la calidad de vida de las personas con discapacidad visual, señalan que hoy muchas personas ciegas o con baja visión en la Argentina utilizan herramientas como Be My Eyes, Seeing AI, Cash Reader y también Gemini integrado con TalkBack. Según explican, la incorporación de inteligencia artificial volvió más precisas algunas funciones que ya existían, especialmente en la descripción detallada de imágenes, por ejemplo al describir ambientes, ropa, fotos, pizarrones o fotocopias. Sin embargo, persisten límites claros: la necesidad de buena conectividad, contar con un celular lo suficientemente potente —por lo general de gama media o alta— y el hecho de que en algunas situaciones la asistencia humana sigue siendo necesaria.

Gonzalo Román, que tiene discapacidad visual y trabaja en Tiflonexos, aseguró en diálogo con LA NACION que “la inteligencia artificial ha mejorado mucho mi vida cotidiana. Uso Seeing AI y Be My Eyes para que me describan imágenes, lo que me permite acceder a fotos, textos en imágenes y productos en casa, dándome más autonomía y facilitando la accesibilidad en mi entorno”. Luego detalló usos concretos: enterarse de lo que muestran las fotos que circulan en grupos de WhatsApp, leer flyers en los que el texto está incrustado dentro de una imagen o identificar productos del supermercado. “Gracias a estas herramientas puedo saber si la caja que estoy abriendo es de mate cocido o si la de arroz es integral”, explicó.

La Federación Argentina de Instituciones de Ciegos y Ambliopes (FAICA) agrega otra dimensión al debate: la laboral. Desde la federación sostienen que estas herramientas no solo sirven para resolver tareas cotidianas, sino también para estudiar, buscar trabajo y desempeñarse con mayor autonomía en un empleo. Mencionan ejemplos concretos: preparar un currículum con herramientas accesibles y revisar después su formato, leer documentación en papel durante una entrevista, interpretar gráficos o imágenes en material de trabajo, verificar datos antes de firmar un documento o reconocer señalización dentro de un edificio desconocido. En esa línea, remarcan que la inteligencia artificial no viene a reemplazar tecnologías de apoyo ya consolidadas, como los lectores de pantalla, sino a complementarlas allí donde históricamente lo visual fue más difícil de resolver de manera autónoma.

Análisis y proyecciones: el recorrido de estas herramientas deja en claro que la accesibilidad visual está pasando de un modelo de asistencia puntual a otro de interpretación contextual. Eso puede ampliar la autonomía en el hogar, en la calle, en el estudio y en el trabajo, especialmente para quienes no cuentan con apoyo humano permanente. Sin embargo, el impacto real dependerá de tres factores decisivos: la calidad de los modelos, la disponibilidad de dispositivos accesibles y la reducción de la dependencia de internet. A medida que la IA se vuelva más local y más eficiente, podría ganar velocidad, privacidad y confiabilidad; pero si el entorno digital sigue mal diseñado, el beneficio seguirá siendo parcial. En otras palabras: la tecnología puede achicar una brecha importante, aunque no reemplaza la obligación de construir servicios, aplicaciones y sitios verdaderamente inclusivos.

La adopción, sin embargo, todavía está lejos de ser generalizada. Esa mirada coincide con lo que vienen señalando usuarios y organizaciones del sector: el avance existe, pero no llega a todos por igual. Hace falta infraestructura, entrenamiento y diseño accesible para que estas soluciones no queden reservadas a quienes tienen más recursos o mayor familiaridad tecnológica.

Las empresas del sector también están tratando de llevar esa lógica más allá del celular. En marzo, Be My Eyes anunció dos movimientos que muestran hacia dónde va el mercado: por un lado, informó que ya superó 1 millón de usuarios ciegos o con baja visión y 10 millones de voluntarios; por otro, lanzó junto con Meta nuevas funciones para conectar, mediante comandos de voz y video manos libres, a usuarios con contactos de confianza o con equipos de soporte a través de las gafas Ray-Ban Meta y Oakley Meta. Ese mismo mes presentó además Workplace AI, un asistente de escritorio pensado para describir diapositivas, capturas, paneles, pizarras y otros contenidos visuales del trabajo cotidiano. La dirección del mercado es clara: la categoría ya no apunta solo a leer etiquetas o carteles, sino también a cubrir entornos laborales y flujos de información más complejos.

En paralelo, apareció otra tendencia que puede resultar incluso más relevante que las gafas: sacar parte de este procesamiento de la nube y llevarlo al propio dispositivo. El 2 de abril, Envision anunció junto con ARM y Google una integración para ejecutar en smartphones funciones como la descripción de escenas y las preguntas visuales de seguimiento de manera local, usando modelos Gemma, sin necesidad de enviar cada imagen a la nube.

La empresa presentó ese cambio como una mejora en tres frentes que en accesibilidad no son menores: menor latencia, mejor funcionamiento offline o con mala conectividad y más privacidad al mantener el procesamiento en el equipo. En este punto, la discusión es especialmente sensible: enviar cada imagen a la nube puede implicar demoras, consumo de datos y también dudas de privacidad cuando lo que se muestra son documentos, medicamentos, ropa o escenas del hogar. Para mercados como el argentino, donde el acceso a buen hardware y buena conexión no siempre acompaña, esa diferencia puede ser más decisiva que cualquier demostración futurista con gafas.

Pero también aparece el límite de la promesa. Porque, pese a los avances, estas herramientas no equivalen a autonomía total ni a una comprensión infalible del entorno. Tiflonexos marca tres barreras concretas: la necesidad de buena conectividad, el costo de contar con un celular adecuado y el hecho de que, cuando la IA no alcanza, la asistencia humana sigue siendo necesaria. La propia Apple, en su guía de funciones de reconocimiento y descripciones en vivo, advierte que esas capacidades no deben usarse en situaciones donde la persona pueda resultar dañada, ni para navegación, ni para diagnóstico o tratamiento médico. El avance existe, sí, pero incluso las propias compañías dejan en claro que todavía no conviene confundir ayuda con certeza.

Lucía Torres, técnica en comunicación social e integrante de la comisión directiva de la Biblioteca Argentina para Ciegos, coincide en que estas herramientas son especialmente valiosas para quienes viven solos o no cuentan con ayuda constante para las tareas cotidianas. “Uso Be My Eyes porque me describe la ropa que tengo disponible y así puedo vestirme y también combinar ropa y accesorios, aunque siempre lo chequeo antes con mi mamá o con amigos, por las dudas”, contó a LA NACION. En su caso, explica que, aunque tiene ceguera total, vio los colores hasta los 7 años, por lo que conserva una referencia visual que le permite aprovechar mejor ese tipo de descripciones. También destaca que estas aplicaciones ayudan a describir objetos del entorno, comidas o cosas tiradas en el suelo, e incluso pueden sugerir decisiones cotidianas, como elegir qué cocinar en función de lo que hay en la heladera o en la alacena.

Pero incluso en ese escenario, señala que sigue habiendo una barrera más básica que la tecnología todavía no resuelve por sí sola: la accesibilidad general del entorno digital. “Muchas apps y páginas web, cuando se actualizan, no dejan los accesos en el mismo lugar que estaban antes, y eso dificulta mucho la lectura”, advierte.

La evolución de los últimos años muestra un cambio de postura de los actores principales: las grandes tecnológicas ya no presentan la accesibilidad como una función secundaria, sino como una línea de desarrollo integrada a sus ecosistemas; las organizaciones de usuarios, en tanto, pasaron de evaluar herramientas aisladas a exigir soluciones más completas, confiables y usables; y las personas con discapacidad visual comenzaron a usar estas apps no solo para leer, sino para tomar decisiones cotidianas con más independencia. Aun así, el consenso sigue siendo el mismo: la IA puede describir una escena, leer un envase o sugerir una combinación de ropa, pero si una aplicación o una web deja de ser accesible después de una actualización, el problema ya no está en la cámara ni en el algoritmo, sino en el diseño de un entorno digital que todavía no termina de incluir a todos.