Contacta con nosotros

Economía

Microsoft crea la IA que muchos necesitan.

Publicado

en

La robótica avanza a pasos agigantados, pero la mayoría de los robots todavía enfrenta una limitación esencial: la dificultad para tomar decisiones precisas respecto a qué acción llevar a cabo y dónde realizarla. Microsoft, junto a un consorcio de investigadores académicos, ha introducido un nuevo estándar, GroundedPlanBench, que pretende solucionar este desafío y acercar la inteligencia artificial de los robots a una toma de decisiones más eficiente y contextualizada.

En los sistemas robóticos tradicionales, el proceso de decisión se distribuye en dos etapas. En primer lugar, un modelo de visión y lenguaje elabora un plan en lenguaje natural. Posteriormente, otro sistema convierte ese plan en acciones físicas. Este enfoque fragmentado genera errores frecuentes, ya que la desconexión entre el plan y la ejecución permite que las equivocaciones en una etapa se transfieran a la siguiente.

Errores comunes incluyen confusiones sobre qué objeto manipular o la creación de pasos innecesarios. Por ejemplo, si se le indica a un robot que descarte vasos de papel, podría no identificar correctamente cuál vaso recoger o incluso realizar acciones no solicitadas. Estas fallas se intensifican en entornos desordenados, donde los objetos son similares o abundantes.

GroundedPlanBench: un nuevo estándar para mejorar la toma de decisiones

Para abordar este reto, Microsoft y sus socios han creado GroundedPlanBench, un sistema que evalúa si los modelos de IA son capaces de planificar tareas y, al mismo tiempo, determinar con precisión el lugar donde debe ejecutarse cada acción.

A diferencia de los sistemas convencionales que solo utilizan texto, este estándar asocia cada acción a una ubicación específica en una imagen. Acciones como agarrar, colocar, abrir o cerrar se conectan a objetos o posiciones concretas, obligando a la IA a relacionar la decisión con el entorno físico real.

El benchmark incluye más de mil tareas basadas en interacciones reales de robots. Algunas instrucciones son directas, como colocar una cuchara en un plato, mientras que otras son más abiertas, como ordenar una mesa. Esta variedad es crucial, dado que los robots suelen fallar cuando las indicaciones no son lo suficientemente claras.

En uno de los experimentos, un robot debía colocar cuatro servilletas en un sofá. La falta de especificidad en la instrucción llevó al sistema a repetir la acción sobre la misma servilleta, incluso con descripciones aparentemente más precisas como “servilleta superior izquierda”. Esto pone de manifiesto que el lenguaje ambiguo sigue siendo un obstáculo para la ejecución confiable de tareas complejas.

Aprendizaje basado en tareas reales

Para aumentar la capacidad de decisión, el equipo desarrolló un método de entrenamiento denominado Video-to-Spatially Grounded Planning (V2GP). Este sistema examina videos de robots realizando tareas, detecta interacciones con objetos, los identifica y rastrea sus ubicaciones, generando así planes estructurados que vinculan cada acción con un punto específico.

Con este enfoque, los investigadores generaron más de 40.000 planes “arraigados”, que abarcan desde acciones simples hasta secuencias complejas de hasta 26 pasos. Los modelos entrenados con este método han demostrado una mejor capacidad para seleccionar acciones pertinentes y asociarlas con los objetos correctos, además de disminuir errores repetitivos como actuar varias veces sobre el mismo elemento.

Un cambio de paradigma para la robótica

A pesar de los avances, persisten los desafíos, especialmente en tareas largas y con instrucciones indirectas. Los investigadores señalan que los modelos deben ser capaces de razonar sobre secuencias extensas y mantener coherencia a lo largo de múltiples pasos. Al comparar el nuevo enfoque con los sistemas tradicionales, se observó que estos últimos tienden a asignar múltiples acciones al mismo objeto o lugar, sobre todo cuando las órdenes son ambiguas.

La integración de planificación y localización en un único proceso reduce estos errores y permite decisiones más precisas. El equipo de Microsoft sugiere que futuras investigaciones podrían combinar este método con modelos predictivos que anticipen las consecuencias de cada acción, ayudando así a los robots a evitar errores en tiempo real.

Las conclusiones del estudio apuntan a una dirección clara para el futuro de la robótica: los sistemas que consideran conjuntamente la acción y la ubicación tienen mayores probabilidades de funcionar con éxito en entornos reales. Esta innovación representa un paso clave para que los robots puedan decidir y actuar de manera confiable en tareas cotidianas, acercándolos a una verdadera inteligencia artificial aplicada.

creditos de las imagenes de este post: Deultimominuto.net

Clic para comentar

Dejar Un Comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Senado De La República Dominicana

Presidencia de la República

Publicidad Privada

Ministerio de la Vivienda y Edificaciones

Publicidad Privada

[rd_gas]