Covariant e RFM-1: quando i robot di magazzino imparano a pickare oggetti mai visti

  • Home
  • Covariant e RFM-1: quando i robot di magazzino imparano a pickare oggetti mai visti
Illustrazione di un braccio robotico che preleva un collo mediante visione artificiale

Il limite storico dei robot di magazzino non è la velocità del braccio. È la varietà. Un braccio programmato per prelevare sempre lo stesso pezzo, nella stessa posa, con la stessa illuminazione, è affidabile. Basta che cambi la confezione, arrivi un SKU nuovo o un oggetto sia messo di traverso nel contenitore, e il ciclo si ferma: serve un integratore, un nuovo programma, una nuova campagna di test.

È il motivo per cui l’automazione del picking è rimasta a lungo più facile da descrivere che da estendere a cataloghi misti. Covariant, nata nel 2017 nella Bay Area, ha tentato di spostare il problema dal codice al modello: invece di insegnare al robot ogni oggetto, addestrare un’intelligenza che generalizzi su oggetti mai visti e, dal 2024, che risponda anche a istruzioni in linguaggio naturale.

Chi è Covariant, e perché è nata dal picking reale

Covariant (in origine Embodied Intelligence) ha sede a Emeryville, in California. I fondatori arrivano dalla ricerca, non dall’hardware: Pieter Abbeel, docente a UC Berkeley e direttore del Robot Learning Lab, insieme a Peter Chen, Rocky Duan e Tianhao Zhang, suoi ex studenti. Abbeel, Chen e Duan avevano lavorato anche in OpenAI. L’idea di partenza era precisa: non costruire un nuovo braccio, ma un software — il Covariant Brain — capace di far vedere, ragionare e agire robot già esistenti in magazzino, mescolando imitation learning e reinforcement learning.

Dal 2018 l’azienda ha iniziato a raccogliere dati da decine di varianti di bracci in magazzini reali. Non dataset da laboratorio: prelievi, fallimenti, retry, misure di forza e immagini di contenitori disordinati. Quel volume di interazioni fisiche è diventato il vero asset. Senza di esso, un modello linguistico resta bravo a parlare di mele e scarso a prenderle.

Il modello commerciale era da software, non da costruttore di macchine: il Brain si appoggiava a partner di automazione. Nel 2020 arrivarono le partnership con ABB e con KNAPP. Quest’ultima ha integrato il sistema di visione di Covariant nel Pick-it-Easy Robot, accoppiato al software KiSoft. A marzo 2024 KNAPP dichiarava 26 clienti attivi in Europa, Nord America e Australia, tra cui Würth, McKesson e Brødrene Dahl. Altri nomi comparsi nei rollout: Radial (putwall robotizzati), Otto Group, GXO.

Ad aprile 2023, in occasione di un aumento da 75 milioni di dollari che portava la raccolta complessiva a circa 222 milioni, Covariant dichiarava clienti in 15 Paesi e quasi 300 robot alimentati dal Brain. Le applicazioni coprivano picking goods-to-person, kitting, depalletizzazione, induction e sortation degli ordini. Non è «oltre 100 bracci in un laboratorio»: è una flotta già in produzione, su hardware di terzi, con ricavi da licenza/software e non dalla vendita del robot.

RFM-1: un foundation model addestrato sul magazzino, non sul web

L’11 marzo 2024 Covariant ha presentato RFM-1, Robotics Foundation Model 1. È un transformer multimodale da 8 miliardi di parametri. Il punto tecnico, più della cifra, è l’addestramento: il modello parte da un large language model preaddestrato e viene poi allenato a predire il token successivo su testo, immagini, video, azioni del robot e letture numeriche dei sensori raccolte in esercizio. Immagini e video restano a risoluzione contenuta (512×512, 5 fotogrammi al secondo): non è un generatore di clip spettacolari, è un modello che deve stare dentro un ciclo di picking.

Covariant lo descrive come un modello «any-to-any»: tutte le modalità vengono tokenizzate nello stesso spazio, quindi il sistema può prendere in ingresso una frase o un’immagine e produrre in uscita testo, un’azione o un fotogramma futuro. In pratica, prima di muovere il gripper, può simulare l’esito — ad esempio come apparirà il contenitore dopo aver rimosso un articolo — e scegliere la sequenza più plausibile.

Nelle dimostrazioni pubbliche il robot risponde a comandi del tipo «prendi l’oggetto rosso» o, più ambigui, «prendi quello che ti metti ai piedi prima delle scarpe» (calzini). Sa anche chiedere aiuto: «non riesco a fare una presa stabile, hai un suggerimento?». Se l’operatore risponde di spostarsi di due centimetri e ribaltare delicatamente l’oggetto, il sistema esegue e riprova. Per un magazzino questo è più interessante della conversazione in sé: significa che un capo turno può correggere un comportamento senza riaprire un progetto di programmazione.

Peter Chen, allora CEO, lo ha sintetizzato così a TechCrunch: RFM-1 è «un large language model, ma per il linguaggio dei robot». L’obiettivo dichiarato non era solo il magazzino, ma una piattaforma riusabile anche in manufacturing, food processing, riciclo e agricoltura. Nel 2024, però, il valore dimostrato restava lì dove c’erano i dati: picking e handling di SKU eterogenei.

Cosa cambia in piazzale, e cosa no

Tre conseguenze operative, se si prende sul serio il caso e non lo slogan «ChatGPT per robot».

La prima: il collo di bottiglia si sposta dalla programmazione alla qualità dei dati. Un robot tradizionale fallisce su uno SKU nuovo perché nessuno ha scritto la regola. Un foundation model fallisce se la flotta non ha visto abbastanza casi simili — imballi trasparenti, blister, sacchetti, flaconi piccoli. Per questo Covariant insisteva sul fatto che i robot connessi «imparano come flotta»: un miglioramento visto in un sito può propagarsi agli altri. È un vantaggio di rete, non un vantaggio di polso meccanico.

La seconda: l’interfaccia in linguaggio naturale riduce, almeno in teoria, la dipendenza dall’integratore per le micro-variazioni. Non elimina l’integrazione con WMS, shuttle goods-to-person, sorter a tasche e sicurezza. KNAPP non ha sostituito KiSoft con una chat: ha messo l’AI di visione e ragionamento dentro una cella già progettata per l’intralogistica. Il foundation model non è un WMS e non decide da solo le priorità d’ordine.

La terza: questo tipo di automazione resta, oggi, territorio di grandi reti e system integrator. I nomi sul campo — McKesson, GXO, Otto, Radial, Würth — descrivono volumi, mix SKU e budget di automazione lontani da un magazzino PMI da poche decine di ordini al giorno. Per chi sta valutando un primo passo, la lezione utile non è «comprare un RFM». È chiedersi se il vero problema è la velocità del prelievo o la varietà che rende fragile qualsiasi programma fisso.

Poi è arrivata Amazon

Il 30 agosto 2024 Amazon ha annunciato un accordo commerciale con Covariant: licenza non esclusiva sui robotic foundation model, assunzione di Abbeel, Chen e Duan, più circa un quarto del personale, nel team Fulfillment Technologies & Robotics. Amazon ha scritto che i modelli avrebbero aiutato a generalizzare l’apprendimento della propria flotta — Robin, Proteus, Sequoia e gli altri sistemi già in esercizio — e che Covariant avrebbe continuato a servire «dozzine di clienti».

La struttura dell’operazione è quella che in Silicon Valley si chiama reverse acquihire: non si compra l’azienda per intero, si assumono i cervelli e si prende una licenza sulla tecnologia. Serve a chiudere in fretta e, secondo i critici, a ridurre lo scrutinio antitrust rispetto a una fusione formale. Nel gennaio 2025 il Washington Post ha reso pubblica una denuncia di un whistleblower a FTC, SEC e Dipartimento di Giustizia: l’accordo varrebbe 380 milioni di dollari più 20 milioni di pagamento di licenza differito, ben sotto la valutazione da 625 milioni attribuita a Covariant nel 2023. La denuncia parla di «azienda zombie», diluizione delle quote di investitori e dipendenti, e vincoli pesanti su future licenze a terzi. Sono accuse, non sentenze. Amazon, dal canto suo, ha presentato l’intesa come licenza non esclusiva e crescita del team Bay Area.

Il fatto osservabile, indipendente dal contenzioso, è un altro: dopo l’annuncio il sito e i canali pubblici di Covariant si sono fermati. Il pezzo di tecnologia più avanzato sul picking generalista è finito, in larga parte, dentro l’operatore che ha già la flotta robotica più grande al mondo. Per i clienti europei che avevano scelto Covariant proprio per non dipendere da un unico ecosistema, è un rischio di fornitore che va messo in conto insieme al throughput.

La lezione utile, al di là del nome dell’azienda

Covariant resta l’esempio più nitido di come un foundation model robotico si costruisce sul serio: ricercatori di primo piano, anni di dati di picking reale, un modello multimodale da miliardi di parametri, deploy su centinaia di bracci, ricavi da software. Resta anche l’esempio di quanto quel vantaggio sia fragile se i dati e il team non sono aperti: chi possiede il dataset di magazzino possiede il modello, e chi possiede il modello può assorbire il team.

Per chi gestisce un magazzino italiano la domanda pratica non è se RFM-1 arriverà sul proprio shuttle l’anno prossimo. È se, nel proprio layout, il mix di SKU sta già rendendo obsoleta l’automazione «a programma fisso» — e se, quando si sceglie un fornitore di visione e AI, si sta comprando una competenza che resterà sul mercato o una che può sparire in un accordo di licensing.

Nota

Ricostruzione basata su comunicati e interviste pubbliche: lancio RFM-1 (Covariant / Business Wire e TechCrunch, marzo 2024), round 2023 e consistenza della flotta (Business Wire / Index Ventures), partnership KNAPP (comunicato KNAPP), accordo Amazon (comunicato Amazon, 30 agosto 2024) e resoconto del Washington Post sulla denuncia del whistleblower (gennaio 2025). L’inquadramento operativo è a cura di Gazzetta Logistica.

  • Condividi

Francesco

Ingegnere informatico, Consulente logistico e co-founder di Gazzetta Logistica. Mi occupo di Logistica dal 2012. Da alcuni anni lavoriamo alla realizzazione del software gestionale SWEET per la gestione del magazzino e dei trasporti, il quale sta riscontrando un buon successo nelle varie installazioni.

La nostra NEWSLETTER

Categorie