Hola a todos,
estoy explorando un problema que creo que puede resultar interesante para quienes trabajan con ROS 2, VLA/VLM, embodied AI, visión por computador y manipulación robótica.
El contexto es un viñedo.
La pregunta no es simplemente: ¿cómo automatizamos la poda u otra operación?
La pregunta que me interesa es más profunda:
¿puede un robot observar una vid, comprender su estructura y contexto, interpretar un objetivo definido por una persona y aprender progresivamente cómo intervenir, en lugar de limitarse a ejecutar una secuencia programada?
Imagino algo donde perception, reasoning y action trabajen conjuntamente:
Observe → Understand → Act → Verify → Learn.
ROS 2 podría formar parte de la infraestructura, mientras que VLA/VLM, learning from demonstration, percepción 3D y manipulation podrían contribuir a la capa de inteligencia y aprendizaje.
Si alguien está experimentando con algo parecido — incluso en sectores completamente distintos de la agricultura — me encantaría intercambiar ideas sobre arquitecturas, límites y posibles enfoques.