Visual Analysis per l'app desktop OpenAI e Claude
Visual Analysis analizza immagini generando un report dettagliato. Dal GPT al plugin, il rilascio MIT su GitHub e l'uso in Codex Desktop e Claude Desktop.
Ho aggiornato Visual Analysis, il mio secondo GPT personalizzato convertito in plugin, e ne ho pubblicato le istruzioni su GitHub con licenza MIT. Il progetto analizza fotografie, dipinti e altre immagini con una funzione estetica, poi produce un PDF con l'immagine e un'analisi dettagliata. L'articolo spiega il metodo, le differenze rispetto al GPT e l'installazione nell'app desktop OpenAI e nell'account Claude, per l'uso su web e Desktop. Un test con una fotografia di rugby mostra come l'analisi colleghi composizione, luce, tecnica e tensione dell'azione.
Il secondo GPT che aggiorno a plugin
Visual Analysis è il secondo GPT personalizzato che aggiorno a plugin, usando la procedura automatica di traduzione prevista da OpenAI. La procedura converte le istruzioni del GPT nel formato di una skill, cioè un insieme di istruzioni riutilizzabili per svolgere un compito.
Il passaggio da GPT a plugin è già illustrato nell'articolo su Idea Organizer. Con Visual Analysis ho ripreso lo stesso percorso, come nel caso precedente ho approfittato dell'operazione anche per aggiornare le funzionalità.
Il GPT di partenza si chiamava Photo analyst ed era rivolto soprattutto ai fotografi, durante l'aggiornamento ho esteso il campo alle immagini con una funzione estetica. Ora si può applicare anche a dipinti, disegni, illustrazioni, manifesti, copertine, loghi e altre composizioni visive.
Ho scelto il nome Visual Analysis per descrivere questo campo più ampio. Altra scelta, ho anche deciso di distribuire il progetto su GitHub con licenza MIT per distribuirlo con un pacchetto utilizzabile in Codex Desktop e Claude Desktop.
Che cosa fa Visual Analysis
Visual Analysis legge una singola immagine e produce una lettura che collega l'interpretazione alle scelte visive osservabili nell'opera.
Ho costruito le istruzioni intorno a due domande. Che cosa racconta l'immagine? E come lo racconta? Nel caso di una fotografia sportiva, per esempio, il modello deve considerare l'azione e le forze che si oppongono, deve spiegare come l'inquadratura, i gesti e il momento fotografato suggeriscano una possibile evoluzione dell'azione fermata dallo scatto.
L'analisi comprende composizione, gerarchia visiva, luce, colore e aspetti tecnici pertinenti al mezzo. La gerarchia visiva riguarda ciò che attira lo sguardo, il percorso dell'occhio e il rapporto fra elementi principali e secondari.
Il modello deve motivare anche il punto di forza e il punto debole. Ogni giudizio deve trovare un riscontro nell'immagine, per esempio nella leggibilità dei gesti o nel rapporto fra figura e sfondo.
Ho previsto eventuali riferimenti artistici e fotografici quando aiutano a comprendere l'opera. Un riferimento richiede un legame spiegato e verificabile, ma una somiglianza generica con un autore non basta per attribuire un'influenza.
Visual Analysis legge l'immagine nella forma presentata, senza proporre ritocchi, nuove composizioni o varianti. Le decisioni di intervento restano all'autore. È pensata per immagini con una funzione estetica, per cui grafici, tabelle e diagrammi operativi restano fuori dal campo del progetto.
Alla fine viene generato un PDF scaricabile che contiene l'immagine completa, le sezioni dell'analisi e una sintesi critica. Ho chiesto una forma editoriale sobria, con testo leggibile, margini adeguati e una gerarchia chiara dei titoli.
Come si usa
Dopo l'installazione si allega una sola immagine alla conversazione e si richiama Visual Analysis. Non servono titolo, autore, intenzioni, impostazioni della fotocamera o una descrizione preliminare.
Nell'app desktop OpenAI le skill locali si richiamano con $, sia nella parte Codex sia nella parte ChatGPT. Per usare Visual Analysis si scrive $visual-analysis e si seleziona la voce locale.
Le skill di account si richiamano con @ e devono essere installate a livello di account, anche attraverso un plugin che le contiene. Per esempio, @Visual Analysis richiama la versione di account quando è installata. OpenAI distingue queste modalità nella documentazione sulla distribuzione delle skill.
In Claude, sia nell'app desktop sia nell'interfaccia web, si può chiedere "Usa Visual Analysis per analizzare l'immagine allegata". La skill si può anche richiamare usando /visual-analysis.
In presenza di un'immagine pertinente le istruzioni prevedono l'avvio dell'analisi completa. Se manca l'allegato il modello deve richiederlo, se gli allegati sono più di uno deve chiedere quale immagine analizzare.
Le istruzioni pubblicate su GitHub sono in inglese, ma il documento segue la lingua della richiesta o della conversazione. Se nessuno di questi elementi permette di determinarla, il modello usa l'inglese come ultima opzione. La lingua dell'interfaccia entra nella scelta solo quando è effettivamente disponibile nel contesto.
Che cosa cambia rispetto al GPT personalizzato
Con il GPT personalizzato si apriva uno strumento dedicato all'interno di ChatGPT, la skill rende il metodo disponibile come una procedura richiamabile durante l'intero ambiente di lavoro.
OpenAI descrive la conversione delle istruzioni in skill nella documentazione sulla migrazione dei GPT. La migrazione richiede prove sul risultato, perché il modello scelto nel GPT non viene trasferito e gli strumenti disponibili possono cambiare.
Per Visual Analysis ho rivisto anche il contenuto delle istruzioni. Ho ampliato il campo oltre la fotografia e precisato la profondità richiesta, comprese le valutazioni tecniche e i riferimenti artistici insieme alla produzione del PDF.
Prima della consegna, il modello deve verificare che note e fonti sostengano esattamente il rapporto descritto nel testo. Questo controllo serve a ridurre le contraddizioni; il risultato richiede comunque una lettura critica.
Il rilascio su GitHub per le due app desktop
Ho deciso di caricare Visual Analysis su GitHub, senza dipendere dal marketplace di OpenAI, per renderlo disponibile sia a chi usa Codex Desktop che a chi usa Claude Desktop.
La licenza MIT permette di usare, modificare e redistribuire il pacchetto gratuitamente, rispettando le regole definite nella licenza.
La fotografia di rugby usata per la prova resta coperta dal mio copyright ed è esclusa dalla licenza MIT. La sua pubblicazione come esempio non concede il permesso di riutilizzarla.
La pagina contiene le istruzioni per entrambe le app e un esempio di analisi.
Installazione in Codex Desktop
Si estrae lo ZIP e si copia la cartella visual-analysis nella directory personale delle skill. Su Windows la destinazione è C:\Users\<nome-utente>\.agents\skills\. Su macOS è ~/.agents/skills/.
Il file delle istruzioni deve quindi trovarsi in .agents/skills/visual-analysis/SKILL.md. Si apre una nuova conversazione e si seleziona Visual Analysis; se non compare, si riavvia l'app. La documentazione OpenAI sulle skill descrive le cartelle utilizzate per l'installazione locale.
Installazione nell'account Claude (web e Desktop)
Questa procedura installa Visual Analysis nell'account Claude. Dopo il caricamento e l'abilitazione, la skill è disponibile sia nell'app desktop sia nell'interfaccia web, usando lo stesso account. È sufficiente caricare lo ZIP una sola volta.
Si mantiene lo ZIP intatto e si apre "Customize > Skills" in Claude, dal web o dall'app desktop. Si seleziona "+", poi "Create skill" e "Upload a skill". Dopo il caricamento si abilita Visual Analysis.
Anthropic descrive questa procedura nella guida all'uso delle skill personalizzate e conferma l'uso delle skill su web e Desktop nella guida all'app desktop. Per generare il PDF devono essere abilitate l'esecuzione del codice e la creazione dei file.
Lo stesso pacchetto, grazie a uno standard di fatto
Lo stesso pacchetto di Visual Analysis scaricato da GitHub si può installare sia in Codex Desktop sia in Claude Desktop. Cambia la procedura di installazione, mentre le istruzioni del metodo restano le stesse.
Questa compatibilità è un esempio concreto di ciò che permette uno standard di fatto, prodotti diversi adottano un formato comune e rendono possibile riutilizzare lo stesso materiale. In questo caso si tratta del formato aperto Agent Skills, che organizza le istruzioni in un file SKILL.md, accompagnato dalle eventuali risorse necessarie.
Chi sviluppa una skill può quindi distribuire un solo pacchetto agli utenti di applicazioni compatibili con quel formato. Chi desidera usare Visual Analysis può scegliere fra i due fornitori mantenendo lo stesso metodo di analisi. Il modello e gli strumenti dell'app continuano a influire sul risultato.
Un esempio con una fotografia di rugby
Per verificare la lettura dell'azione ho sottoposto a Visual Analysis questa mia fotografia di rugby. Una giocatrice tiene il pallone contro il corpo, mentre altre due figure convergono su di lei.

Fotografia © Paolo Dalprato. Tutti i diritti riservati. Esclusa dalla licenza MIT del progetto.
Ho chiesto un'analisi che rendesse conto della possibile avanzata e della resistenza, senza inventare l'esito della giocata. Il singolo fotogramma permette di osservare indizi di entrambi gli sviluppi.
Segue il testo integrale dell'analisi completa.
Cosa racconta
Il fotogramma trattiene una fase decisiva del contatto nel rugby: una giocatrice protegge il pallone contro il corpo mentre altre due la stringono da direzioni diverse. Il volto contratto e le braccia serrate registrano uno sforzo ancora in corso. Non vediamo una meta né un arresto compiuto. La domanda che l'immagine apre è concreta: riuscirà a sfondare, oppure la pressione combinata fermerà la sua avanzata?
Come lo racconta
La fotografia rende visibile questa incertezza attraverso corpi che convergono sul pallone, una ripresa molto vicina che toglie il contesto del campo e un istante tanto breve da lasciare sospese le gocce nell'aria. Il movimento è percepibile proprio perché viene fermato nel punto in cui le forze si oppongono, prima che una delle due prevalga.
Gerarchia visiva e percorso dell'occhio
La grande schiena rossa in primo piano occupa molto spazio e cattura lo sguardo per massa e saturazione. L'occhio passa poi al pallone chiaro, stretto fra le braccia, e risale al volto della portatrice, il profilo scuro più espressivo contro il fondo luminoso. Da lì, la testa che emerge alle sue spalle e il corpo piegato in basso riportano lo sguardo al centro del contatto. Il pallone è il perno narrativo; il volto ne traduce il costo fisico.
Composizione e vettori di forza
La portatrice inclina spalle e testa verso sinistra, nella direzione che il bordo del quadro lascia intuitivamente aperta. La figura in primo piano entra invece da destra e dal basso: la sua schiena curva forma una diagonale ampia che attraversa e comprime il busto centrale. Una seconda presenza, alta e parzialmente nascosta dietro la portatrice, chiude lo spazio alle sue spalle. Le braccia che circondano il pallone disegnano un nodo di linee corte, in contrasto con le diagonali dei busti. La composizione continua a ricondurre l'occhio nel punto in cui il possesso è conteso.
Dinamica e suspense
La palla è ancora saldamente custodita e il corpo della portatrice mantiene una direzione: sono indizi di avanzamento possibile. Ma le altre due figure hanno già ridotto il suo spazio di manovra; quella in primo piano sembra impegnare la parte bassa del corpo, mentre l'altra pesa nella zona delle spalle. L'immagine contiene segnali per entrambi gli esiti, senza provarne nessuno. Il taglio ravvicinato impedisce di vedere appoggi, linea del campo e sviluppi successivi: lo spettatore avverte l'urgenza dell'azione, ma resta nel suo presente.
Tempo fotografico
Le gocce separate, i capelli sollevati e le pieghe tese delle maglie sono tracce di moto congelate. La fotografia non raffigura corpi in posa; seleziona una frazione di secondo nella quale ogni gesto sembra ancora poter cambiare direzione. La sospensione temporale amplifica la domanda sul seguito dell'azione.
Luce, colore e materia
La luce è ampia e morbida: non produce ombre nette, ma rende luminosi lo sfondo e le gocce sospese. I bordi dei capelli ricevono una lieve separazione tonale, mentre il volto rimane relativamente più scuro. Questo rapporto permette di leggere l'espressione senza staccarla dalla fatica fisica del contatto. I pannelli bianchi delle maglie, segnati dal fango, trattengono la memoria materiale del gioco; il rosso vivo lega le figure in una massa compatta contro i verdi e i grigi pallidi del fondo. Il contrasto cromatico isola l'azione; la somiglianza delle maglie, però, rende meno immediata la distinzione dei corpi.
Lettura tecnica
La ripresa è stretta e ad altezza dei corpi, con un fondo molto sfocato che separa il gruppo dall'ambiente. Volto, pallone e tessuto nelle zone centrali conservano dettaglio sufficiente a sostenere la lettura; la forma rossa all'estremo destro è invece fuori fuoco. Il congelamento delle gocce suggerisce un tempo di esposizione breve, ma dal solo JPEG non si possono ricavare valori di otturatore, diaframma o focale. La resa è brillante, con bianchi molto luminosi e rossi intensi; non è possibile attribuirla con certezza alla luce di scena, alla fotocamera o a elaborazioni successive. Il file fornito misura 1000 × 667 pixel: la valutazione del dettaglio fine resta limitata a questa versione.
Riferimento e linguaggio
L'immagine appartiene al linguaggio della fotografia sportiva d'azione e dialoga con il reportage: un evento reale viene condensato in un istante leggibile e insieme aperto. Il fotogramma sceglie un momento cruciale, ma la sua forza non deriva da una geometria ordinata: nasce dalla collisione dei corpi e dall'incertezza su quale spinta prevarrà. Il riferimento pertinente è dunque il racconto visivo dell'azione, senza bisogno di ricondurlo a un autore o a una corrente specifica.
Punto di forza e punto debole
Il punto di forza è la coincidenza fra struttura visiva e conflitto sportivo: le diagonali convergono sul pallone, il volto dà misura umana allo scontro e l'istante fermato mantiene aperta la possibilità di sfondamento o arresto. Il limite principale è la leggibilità dei rapporti fisici: la grande figura in primo piano copre parte della presa e le maglie simili fondono le giocatrici in un unico volume. Questa opacità trasmette la pressione della mischia, ma impedisce di capire con precisione quale gesto determinerà l'esito.
Sintesi critica
La fotografia racconta il rugby come urto fra volontà e resistenza. La sua efficacia sta nel far sentire quanto sia incerto il risultato, e nel trasformare un contatto brevissimo in una scena che continua mentalmente oltre il quadro.
Chi ha scritto questo articolo
Sono Paolo Dalprato, formatore sulle AI generative. Lavoro con professionisti, studi e PMI da una parte, con scuole, biblioteche e istituzioni culturali dall'altra, sull'ecosistema Claude e NotebookLM. Quello che insegno è lo stesso che uso ogni giorno, e finisce qui sul blog prima ancora che in aula.
Autore di «Creatività ibrida: autore e opera nell'era delle macchine intelligenti».
