Djinious
Controllo e apprendimento per rinforzoMetodi di ingegneria

Controllo del cart-pole e RL

Il benchmark canonico del controllo sottoattuato, affrontato end-to-end — dinamica non lineare, un LQR che stabilizza il pendolo invertito, un avviamento a oscillazione energetica, una policy di apprendimento per rinforzo model-free, e un gate di robustezza Monte Carlo.

DjiniousLab
Un grafico del notebook di DjiniousLab del cart-pole che oscilla dalla posizione pendente a quella verticale ed è catturato dal controllore a t = 7,2 s, con la traccia della forza di controllo
x, ẋ, θ, θ̇
4 statix, ẋ, θ, θ̇
tempo di assestamento LQR
3,68 stempo di assestamento LQR
ritorno RL appreso
299.6 / 300ritorno RL appreso
notebook di progettazione
9notebook di progettazione
composizione .djl
1composizione .djl
estrazioni di robustezza catturate su 300
100%estrazioni di robustezza catturate su 300

Cart-pole, dal manuale all’apprendimento per rinforzo.

Un’asta incernierata su un carrello, il carrello spinto da una forza orizzontale — il benchmark con cui inizia ogni corso di controlli, e quello a cui torna ogni paper di RL. Qui è un unico programma: la dinamica non lineare esatta, un LQR a stato completo che cattura il pendolo invertito, un avviamento a modellamento energetico, una policy appresa model-free, e un’approvazione finale di robustezza Monte Carlo — l’impianto e il suo stabilizzatore composti anche come un unico .djl eseguibile sul canvas.

Cinque modi per bilanciare un’asta.

Da un modello derivato a mano a una policy che apprende senza alcun modello — ogni metodo è un proprio notebook eseguibile, tutti sullo stesso impianto.

Dinamica non lineare

Le equazioni del moto esatte del cart-pole, derivate e integrate. L’equilibrio verticale è genuinamente instabile — ∂θ̈/∂θ > 0 — quindi ogni esecuzione senza controllo si ribalta, la giusta baseline da battere.

Stabilizzazione LQR

Una legge di retroazione a stato completo da lqr(A, B, Q, R) porta ogni autovalore ad anello chiuso nel semipiano sinistro e assesta un’inclinazione di 11° fino alla verticale in 3,68 s.

Avviamento a oscillazione energetica

Una legge di modellamento energetico pompa l’asta dalla posizione pendente facendole compiere l’intero giro, poi passa il controllo all’LQR, che la cattura in verticale a t ≈ 7,2 s.

Apprendimento per rinforzo

Una policy a metodo dell’entropia incrociata impara a bilanciare da condizioni iniziali casuali senza alcun modello — convergendo a un ritorno di 299,6/300 da una baseline casuale di −220.

Robustezza

Una scansione Monte Carlo di 300 prove perturba massa del carrello, massa e lunghezza dell’asta del ±30% e dà all’asta impulsi improvvisi — tutte e 300 vengono catturate.

Ottimizzazione dei guadagni

Una ricerca Nelder-Mead limitata ritara i pesi dell’LQR rispetto a un costo ad anello chiuso, tagliandolo del 34,5% mentre i guadagni restano fisicamente plausibili.

DjiniousLab
Un grafico del notebook dell’angolo dell’asta che oscilla da π ed è catturata in verticale, con la traccia della forza di controllo che ha un picco al momento della cattura
Avviamento a oscillazione energetica e cattura: l’asta viene pompata dalla posizione pendente attraverso una sequenza di oscillazioni crescenti, poi il controllore prende il sopravvento e la porta in verticale a t = 7,21 s — la forza di controllo (tratteggiata) ha un picco esattamente al passaggio di consegne.

L’impianto e il suo controllore, composti su un canvas.

L’intero ciclo chiuso — l’impianto cart-pole non lineare e la sua legge LQR a stato completo — è un unico componente .djl acausale. Le sue equazioni sono scritte implicitamente nelle accelerazioni ẍ e θ̈, un piccolo sistema algebrico che il kernel risolve a ogni passo, quindi è un genuino modello differenziale-algebrico che richiede un risolutore stiff Rodas5P, non un passo temporale scritto a mano. Viene tradotto ed eseguito attraverso lo stesso motore di produzione usato dal canvas: rilasciato da un’inclinazione di 0,20 rad, il controllore porta l’asta a 0,005 rad. I guadagni sono gli stessi valori lqr() che i notebook calcolano.

DjiniousLab
Un grafico del notebook degli stati del cart-pole stabilizzato con LQR che si assestano a zero entro 3,68 secondi
Stabilizzazione LQR: da un’inclinazione iniziale, sia la posizione del carrello sia l’angolo dell’asta si assestano a zero in 3,68 s. L’impianto ad anello aperto ha un autovalore a +3,97 nel semipiano destro; la legge di retroazione porta ogni polo ad anello chiuso nel semipiano sinistro.
DjiniousLab
Un grafico del notebook del ritorno dell’apprendimento per rinforzo che sale da una baseline negativa fino a quasi il massimo nel corso delle iterazioni di addestramento
Apprendimento model-free: una policy a metodo dell’entropia incrociata, senza alcun modello di dinamica, impara a bilanciare l’asta da partenze casuali — il suo ritorno sale da una baseline casuale di −220 a un valore convergente di 299,6 / 300.

Ogni risultato è un numero che puoi rieseguire.

Ogni notebook è subordinato al proprio risultato verificato dal worker, e lo stabilizzatore .djl è confermato risolvere attraverso il motore di produzione del canvas.

Risultato

  • Tempo di assestamento LQR: 3,68 s
  • Cattura dell’avviamento a oscillazione: t ≈ 7,2 s
  • Ritorno RL appreso: 299,6 / 300
  • Ottimizzazione Q/R: costo −34,5%
  • Catture di robustezza: 300 / 300

Dettaglio

  • Tempo di assestamento LQR: tutti i poli nel semipiano sinistro
  • Cattura dell’avviamento a oscillazione: θ → 0,0018 rad
  • Ritorno RL appreso: baseline −220
  • Ottimizzazione Q/R: ricerca limitata
  • Catture di robustezza: parametri ±30%

Un benchmark, fatto onestamente.

L’asta è un pendolo a massa puntiforme su un carrello senza attrito — il classico cart-pole da manuale, non un braccio flessibile o multibody. La policy di apprendimento per rinforzo è un metodo lineare dell’entropia incrociata scelto per velocità e riproducibilità, non una rete profonda; l’ottimizzatore è una ricerca locale limitata. Ciò che il programma mostra è l’intero arco — derivare, stabilizzare, avviare a oscillazione, apprendere e verificare — su un unico impianto, con il controllore che vive anche come sorgente acausale componibile che puoi collegare in un sistema più grande.