Ciao a tutti,
sto esplorando un problema che penso possa essere interessante per chi lavora con ROS 2, VLA/VLM, embodied AI, computer vision e robotic manipulation.
Il contesto è un vigneto.
La domanda non è semplicemente: come automatizziamo la potatura o un’altra operazione?
La domanda che mi interessa è più profonda:
può un robot osservare una vite, comprenderne struttura e contesto, interpretare un obiettivo dato dall’uomo e imparare progressivamente come intervenire, invece di eseguire solamente una sequenza programmata?
Immagino qualcosa in cui perception, reasoning e action lavorino insieme:
Observe → Understand → Act → Verify → Learn.
ROS 2 potrebbe essere parte dell’infrastruttura, mentre VLA/VLM, learning from demonstration, perception 3D e manipulation potrebbero contribuire al livello di intelligenza e apprendimento.
Non sto cercando qui una soluzione già pronta.
Mi interessa soprattutto parlare con altri nerd che leggendo questo problema pensino:
“Ok, questa cosa tecnicamente è interessante. Vediamo come potrebbe funzionare.”
Se qualcuno sta sperimentando qualcosa di simile — anche in settori completamente diversi dall’agricoltura — mi farebbe piacere confrontare idee, architetture, limiti e approcci.