
La inteligencia artificial visual puede convertirse en una herramienta cada vez más útil para las personas ciegas o con baja visión. Actualmente, muchas aplicaciones utilizan la cámara del teléfono para describir imágenes, reconocer objetos, leer textos o responder preguntas sobre lo que aparece delante del usuario. Sin embargo, habitualmente este procesamiento depende de servicios en la nube.
En 2026, Envision, Arm y Google están explorando una alternativa: ejecutar modelos de inteligencia artificial visual directamente en el propio teléfono. El objetivo es que determinadas funciones puedan realizarse localmente, sin necesidad de enviar la imagen a servidores externos.
Gemma 4: IA visual que puede funcionar en el propio dispositivo
La tecnología se basa en Gemma 4, la nueva familia de modelos de inteligencia artificial de Google. Entre sus capacidades se encuentra la comprensión de imágenes, que permite realizar tareas como describir una escena, reconocer elementos de una imagen, responder preguntas sobre su contenido o realizar razonamiento visual. Google indica que determinados modelos de Gemma 4 están diseñados para ejecutarse directamente en dispositivos móviles y otros equipos de computación local.
En colaboración con Arm, Envision ha probado esta tecnología para trasladar parte de sus funciones de comprensión visual al propio teléfono. En las pruebas descritas por Arm, el usuario puede capturar una fotografía y recibir una descripción detallada de la escena sin necesidad de enviar esa imagen a la nube ni disponer de conexión de red.
La colaboración aprovecha, además, las capacidades de los procesadores Arm y de Arm Scalable Matrix Extension 2 (SME2), unas instrucciones diseñadas para acelerar determinadas operaciones relacionadas con inteligencia artificial. Según Arm, las pruebas iniciales con Gemma 4 muestran mejoras de rendimiento al ejecutar estas cargas de trabajo en procesadores Arm compatibles.
¿Qué podría suponer para las personas ciegas o con baja visión?
El funcionamiento local de la IA visual podría tener varias ventajas importantes para las tecnologías de apoyo.
Mayor privacidad. Si una imagen puede analizarse directamente en el teléfono, no es necesario enviar esa fotografía a un servidor externo para realizar el procesamiento. Esto puede ser especialmente relevante cuando la cámara está captando personas, documentos, espacios privados u otra información sensible.
Menor dependencia de Internet. Una IA que funciona en el propio dispositivo puede seguir ofreciendo determinadas funciones incluso cuando no existe conexión a Internet. Para una persona ciega o con baja visión, esto puede resultar especialmente interesante cuando utiliza herramientas de descripción visual fuera de casa o en lugares con una cobertura deficiente.
Menor latencia. El procesamiento local también puede reducir el tiempo necesario para obtener una respuesta, ya que la imagen no tiene que viajar hasta un servidor y regresar con el resultado. Arm señala precisamente una menor latencia y una mayor disponibilidad como algunos de los posibles beneficios de trasladar la inteligencia artificial al dispositivo.
De la descripción de imágenes a una conversación sobre el entorno
La propuesta resulta especialmente interesante porque no se limita a obtener una descripción automática de una fotografía.
Envision plantea utilizar esta tecnología para funciones como la descripción de escenas y las preguntas y respuestas sobre información visual. En la práctica, una persona podría apuntar con la cámara del teléfono hacia un entorno, obtener una descripción y realizar posteriormente preguntas relacionadas con aquello que aparece en la imagen.
Este planteamiento parte de tecnologías que ya existen en Envision. Su aplicación permite actualmente utilizar la cámara del teléfono para describir escenas, reconocer objetos y responder preguntas sobre textos o imágenes mediante su asistente de inteligencia artificial. La diferencia de esta nueva línea de investigación está en dónde se realiza el procesamiento: el objetivo es llevar una parte cada vez mayor de esa comprensión visual al propio dispositivo.
Una tecnología todavía en desarrollo
Es importante aclarar que no estamos ante el lanzamiento de un nuevo producto de Envision que ya ofrezca todas estas funciones de forma general y completamente offline.
Envision, Arm y Google están trabajando en esta dirección y han mostrado un prototipo basado en Gemma 4 ejecutándose localmente en hardware Arm. Por tanto, se trata de una línea de desarrollo tecnológico, no de una característica que debamos considerar actualmente disponible en todos los teléfonos o en todas las funciones de Envision.
El avance, sin embargo, apunta hacia un cambio interesante en la evolución de las tecnologías de asistencia: que el teléfono no tenga que enviar continuamente lo que está viendo a la nube para poder comprenderlo.
Para las personas ciegas y con baja visión, esto podría traducirse en herramientas de asistencia visual más rápidas, privadas y capaces de funcionar en más situaciones, incluso cuando no exista conexión a Internet.
Si te ha gustado esta noticia no te pierdas las últimas novedades en tiflotectnología en nuestro apartado de noticias y redes sociales.
Fuentes: Envision, Arm, Google deepmind.
