Sviluppo di agenti AI e integrazione di server MCP: collegare i modelli linguistici ai sistemi che già usate
Le dimostrazioni funzionano sempre. Il pilota che riassumeva la documentazione era notevole, il prototipo che rispondeva alle richieste di assistenza sembrava pronto: poi ha incontrato il CRM vero, il modello dei permessi vero e i dati veri, e ha smesso di essere pronto.
È in quello scarto che sta il lavoro. Non il modello, che ormai è la parte facile, ma tutto ciò che si frappone tra un modello linguistico e un sistema che ha opinioni precise su autenticazione, limiti di frequenza, multi-tenancy e su chi ha il diritto di vedere che cosa.
Che cosa realizziamo
Server MCP per i vostri sistemi interni
Il Model Context Protocol è uno standard aperto per esporre strumenti e dati agli assistenti AI in modo coerente tra client diversi. È diventato la risposta pratica alla domanda "come facciamo a far usare i nostri sistemi a un assistente senza scrivere un'integrazione su misura per ogni assistente".
Costruiamo server MCP di produzione sopra ciò che l'azienda usa davvero: il CRM, il sistema di ticketing, il data warehouse, le API interne, l'archivio documentale, l'ERP. Non un server dimostrativo con il token scritto nel codice, ma uno con autenticazione seria, autorizzazione per utente che rispetta i permessi già applicati dai vostri sistemi, isolamento multi-tenant, limitazione delle richieste, log strutturati e una gestione degli errori che dica al modello qualcosa di utile quando una chiamata fallisce.
Agenti e assistenti AI su misura
Agenti che portano a termine un lavoro dall'inizio alla fine: smistare una coda in ingresso, riconciliare due sistemi che non concordano, preparare la prima versione di un documento che poi una persona approva, condurre una ricerca su fonti interne ed esterne. Li costruiamo con dentro anche le parti noiose: ritenti, timeout, tetti di spesa, idempotenza su qualsiasi operazione di scrittura e un passaggio di approvazione umana ovunque l'azione sia difficile da annullare.
Ricerca e recupero sui vostri contenuti
RAG fatto come si deve: acquisizione e suddivisione dei documenti che rispetta la struttura invece di contare i caratteri, embedding e ricerca vettoriale, ricerca ibrida per parola chiave e semantica (perché la sola ricerca vettoriale manca le corrispondenze esatte) reranking e citazioni alla fonte, così una risposta può essere verificata. Più la metà meno appariscente: tenere l'indice aggiornato mentre i documenti sottostanti cambiano e rispettare i permessi, perché il recupero non deve mai far emergere un documento che l'utente non potrebbe comunque aprire.
Automazione di processi e attività di back office
Non tutto ha bisogno di un agente. Buona parte di ciò che le aziende chiedono all'AI è classificazione, estrazione e instradamento: leggere una e-mail in arrivo e capire di che cosa si tratta, estrarre dati strutturati da un documento non strutturato, associare una descrizione a una voce di catalogo. Sono attività più economiche, più affidabili e più facili da valutare di un agente: quando la risposta giusta è questa, costruiamo questa.
Valutazione, osservabilità e guardrail
Una funzionalità AI senza valutazione è una funzionalità che nessuno può migliorare. Costruiamo insiemi di test a partire dai vostri casi reali, misuriamo a ogni modifica, tracciamo ogni chiamata con input, strumenti usati, latenza e costo, e mettiamo i limiti prima che un ciclo impazzito scopra la vostra fattura delle API. La prompt injection è un rischio concreto dal momento in cui un agente legge contenuti non attendibili e può anche agire: progettiamo il confine tra modello e strumenti in modo che un documento malevolo non possa trasformarsi in un'azione distruttiva.
Come lavoriamo con i fornitori di modelli
Non siamo legati a nessuno. Sviluppiamo con i modelli Claude di Anthropic, con OpenAI, con Google e con modelli a pesi aperti eseguiti sulla vostra infrastruttura, e progettiamo l'integrazione in modo che il modello resti un componente sostituibile. Quale convenga dipende dal compito, dalla latenza che vi serve, dal costo per chiamata ai vostri volumi e (in Europa sempre più spesso il fattore decisivo), da dove i dati possono andare.
Per i clienti con vincoli di residenza dei dati distribuiamo in regioni UE o su inferenza self-hosted sul vostro hardware, e vi diciamo con onestà dove questo vi costa in termini di capacità.
Che cosa non facciamo
Non siamo una società di consulenza strategica sull'AI. Non organizziamo workshop sul potenziale trasformativo di alcunché.
E non costruiamo un agente per un problema che non ne ha bisogno. Una quota non trascurabile dei progetti AI su cui ci chiedono un parere si risolve meglio con un'integrazione API ben specificata, un indice di ricerca o la correzione del problema di qualità del dato che sta sotto. Consigliarlo ci costa un incarico più grande e vi risparmia un sistema da mantenere.
Dove rende di più
La conoscenza interna tecnicamente disponibile e praticamente irraggiungibile: migliaia di documenti tra una wiki, un disco condiviso e un sistema di ticket, dove la persona che sa quale sia la versione valida è in ferie.
Lo smistamento ad alto volume: code di assistenza, apertura sinistri, richieste commerciali, esame di candidature. Tutto ciò in cui oggi una persona legge qualcosa, decide di che cosa si tratta e lo passa avanti.
I sistemi che non hanno mai avuto un'integrazione: due strumenti che dovrebbero parlarsi e non lo fanno, con una persona e un foglio di calcolo a fare da ponte. Un agente con accesso MCP a entrambi è spesso una strada più breve di un progetto di integrazione formale.
Le attività a forte componente documentale: contratti, fatture, capitolati, adempimenti normativi. L'estrazione con un passaggio di revisione umana è già oggi abbastanza affidabile da cambiare l'economia di questi processi.
La produttività degli sviluppatori sul vostro codice: strumenti interni, supporto alla revisione del codice, generazione di test e server MCP che diano agli assistenti del vostro team accesso al sistema di build, al tracker delle issue e ai log.
Come si svolgono i progetti
Discovery, una o due settimane. Guardiamo il processo che volete cambiare, i sistemi coinvolti e l'aspetto reale dei dati. Il risultato è una valutazione scritta di ciò che è fattibile, di quanto costerà al mese ai vostri volumi e di quali siano le modalità di errore. A volte dice di non costruirlo.
Proof of concept, dalle tre alle sei settimane, su dati reali in un ambiente controllato. Il punto non è una demo: è un risultato di valutazione di cui vi possiate fidare, con un'accuratezza misurata su casi scelti da voi.
Realizzazione in produzione, di norma dalle otto alle sedici settimane, comprese autenticazione, autorizzazione, monitoraggio, banco di valutazione, controllo dei costi e documentazione. Rilasciata nella vostra infrastruttura, nel vostro repository, con il vostro team coinvolto dall'inizio alla fine.
Esercizio o passaggio di consegne. O il vostro team prende in carico il sistema, con il runbook e la suite di valutazione, oppure continuiamo a gestirlo noi con un contratto di supporto. I modelli cambiano, i prompt derivano, e la suite di valutazione è ciò che vi dice quando qualcosa è silenziosamente peggiorato.
Tecnologie
Python e TypeScript per il lavoro su agenti e MCP; PostgreSQL con pgvector, Qdrant, Weaviate o OpenSearch per il recupero; AWS Bedrock, Azure OpenAI, API dirette dei fornitori e inferenza self-hosted con vLLM o Ollama dove i dati non possono uscire; tracciamento basato su OpenTelemetry; e qualunque sia il vostro stack sul lato integrazione, perché è lì che si concentra il lavoro vero.
Domande frequenti
Che cos'è un server MCP, in parole semplici?
Un piccolo servizio che espone una capacità (leggere da un database, creare un ticket, cercare tra i vostri documenti), in un formato standard che gli assistenti AI comprendono. Ne costruite uno e qualsiasi assistente compatibile con MCP può usare quella capacità senza un'integrazione dedicata.
Meglio un server MCP o una normale integrazione API?
Se un solo assistente AI deve usare un solo sistema, l'integrazione diretta è più semplice. MCP si ripaga quando più assistenti o più team hanno bisogno degli stessi sistemi, quando volete che la capacità sia disponibile anche per strumenti che non avete ancora scelto, o quando volete un unico punto in cui vivono permessi e log di audit.
Come impedite a un agente di fare qualcosa di distruttivo?
A più livelli. Gli strumenti che scrivono sono separati da quelli che leggono, e quelli in scrittura hanno l'ambito più stretto che il compito consenta. Tutto ciò che è irreversibile passa da un'approvazione umana. Ogni chiamata è registrata con i suoi argomenti. E l'agente gira con un'identità di servizio che ha solo i permessi necessari al lavoro, così il raggio d'azione è limitato dal vostro modello di autorizzazione e non dal prompt.
Quanto costa mantenerlo in esercizio?
Dipende quasi interamente dai volumi e da quanto contesto porta con sé ogni chiamata. Lo modelliamo durante la discovery con numeri reali, perché tra una soluzione che invia l'intero documento a ogni turno e una che ne recupera solo la parte pertinente può esserci un ordine di grandezza di differenza sul costo mensile.
Può funzionare senza che i nostri dati escano dall'UE?
Sì. I principali fornitori offrono regioni UE, e i modelli a pesi aperti possono girare su infrastruttura che controllate voi. Di solito c'è un compromesso sulle capacità, e su quale sia saremo precisi anziché far finta che non esista.
Il nostro ultimo pilota AI non è mai arrivato in produzione. Perché questo sì?
Di solito perché il pilota dimostrava che il modello sapeva svolgere il compito e non toccava mai autenticazione, permessi, gestione degli errori, valutazione o costi, cioè il novanta per cento del lavoro che resta. Noi partiamo dal presupposto che il modello funzioni e dedichiamo il progetto a tutto il resto.
Iniziamo
Descriveteci il processo che volete cambiare e i sistemi che tocca. Vi diremo se un agente è lo strumento giusto, come sarebbe fatta una prima versione realistica e quanto costa costruirla e mantenerla.
Contattateci per fissare una sessione tecnica di discovery.
Servizi correlati
- Potenziamento Personale e Outsourcing: ingegneri AI inseriti nel vostro team
- Conformità all'AI Act dell'UE: per quando ciò che costruite rientra nell'ambito di applicazione
- Ottimizzazione costi AWS: i carichi di inferenza e recupero hanno l'abitudine di sorprendere
Pronto per iniziare con questo servizio?
Contattaci