Certificazione e Raccolta Tracce Online · servizio attivo
WACZ · ISO 28500/ Marca temporale eIDAS/ Area riservata
C.E.R.T.O.
Accedi Registrati gratis
IT EN
C.E.R.T.O. / Moduli / Pagine web
01 · WEB

Pagine web

Cattura una pagina web esattamente come appare in quel momento — con tutto ciò che la compone — e la sigilla prima che possa cambiare o sparire.

Browser forense integrato: barra URL del target e pulsante «Avvia acquisizione». Con «Screenshot» l'operatore cattura la schermata quando lo ritiene opportuno mentre interagisce con la pagina; la navigazione resta confinata allo scope dichiarato.

Il modulo Pagine web di C.E.R.T.O. esegue l'acquisizione forense di siti e pagine web: cattura una pagina nello stato esatto in cui si presenta — testo, immagini, codice, risorse e traffico di rete — e la sigilla come prova digitale prima che possa cambiare o sparire. È lo strumento pensato per CTU, CTP, periti, avvocati e forze dell'ordine che devono cristallizzare un contenuto online — un post diffamatorio, una violazione di copyright, una pagina di e-commerce, una recensione — con piena catena di custodia e validità tecnica.

Caratteristiche principali

Cosa fa questo modulo.

  • Archivio navigabile in formato WACZ (ISO 28500 / WARC).
  • Browser integrato con video recording HD e audio di sistema.
  • Screenshot a pagina intera, traffico HTTP (HAR) e analisi SSL/TLS.
  • Multi-pagina con motore di completezza dei contenuti catturati.
  • Fascicolo BagIt 1.0 firmato Ed25519, doppia marca RFC 3161 e CASE/UCO.
Report forense finale: il cruscotto interattivo index-interactive.html del fascicolo — riepilogo, pagine, screenshot, rete, certificati, completezza, inventario hash e verifica integrità.
Pipeline forense

Come opera il modulo.

Una procedura ripetibile e documentata: dalla sincronizzazione del tempo alla sigillatura crittografica, ogni passaggio lascia una traccia verificabile dentro il fascicolo.

01 · NTP

Tempo sincronizzato

Sincronizzazione NTP multi-sorgente (Google/Cloudflare/pool) con offset e roundtrip documentati: la finestra di cattura è ancorata.

02 · SCOPE

Navigazione confinata

Browser forense integrato con oggetto e scope dichiarati (dominio, dominio+sottodomini o navigazione libera); ogni pagina nello scope diventa un reperto.

03 · CAPTURE

Cattura passiva

Intercettazione passiva del traffico via Chrome DevTools Protocol (dominio Network, niente request-interception) — nessuna alterazione della pagina.

04 · RENDER

Stati visivi e DOM

Per ogni pagina: screenshot del viewport, screenshot a pagina intera (scroll-and-stitch) e snapshot del DOM dopo l'esecuzione del JavaScript.

05 · WACZ

Archivio navigabile

Confezionamento WACZ/WARC (ISO 28500) auto-contenuto: la navigazione si ripercorre offline, byte per byte, con ReplayWeb.page.

06 · COMPLETE

Completezza

Motore di completezza session-aware: confronta risorse viste e catturate, recupera quelle mancanti e dichiara le irrecuperabili.

07 · NETWORK

Rete e TLS

HAR W3C completo, DNS, WHOIS, traceroute e catene di certificati X.509 (leaf + intermedi + root) di ogni host contattato.

08 · HASH

Impronte

Hash quadruplo MD5 + SHA-1 + SHA-256 + SHA-512 (FIPS 180-4) di ogni file, inventariato in file-hashes.json.

09 · SIGN

Firma e doppia marca

manifest.json firmato Ed25519 (RFC 8032) legato al dispositivo + doppia marca RFC 3161 (ancora interna sul manifest, sigillo esterno sul tag-manifest).

10 · SEAL

Fascicolo sigillato

Tutto è confezionato in un fascicolo BagIt 1.0 (RFC 8493) con descrizione CASE/UCO e verificatori verify.sh / verify.bat.

Contenuto del fascicolo

Tutto ciò che viene generato.

Una singola acquisizione produce decine di artefatti coordinati, ciascuno con un ruolo forense preciso. Sono organizzati in cartelle dai nomi parlanti dentro data/.

Screenshot del viewport

Lo schermo visibile durante la navigazione (un fotogramma per pagina), in JPEG con filigrana C.E.R.T.O., versione, ID acquisizione, URL e timestamp impressi.

pages/NNN_…/screenshots/

Screenshot a pagina intera

La pagina intera ricomposta con scroll-and-stitch, oltre la piega, con sfondo appiattito su bianco per fedeltà cromatica. Generato post-hoc per ogni pagina.

pages/NNN_…/screenshots-fullpage/

Snapshot DOM HTML

Il DOM serializzato dopo l'esecuzione del JavaScript (post-hydration), come effettivamente reso dal browser — non il solo sorgente statico.

pages/NNN_…/html-snapshots/

Archivio WACZ

Web Archive Collection Zipped (ISO 28500): WARC + indici, auto-contenuto. Riproduce l'intera navigazione offline con ReplayWeb.page — è il media sigillato.

evidence/ReplayWebPage.wacz

Video della sessione

Registrazione video (WebM) del browser forense durante l'acquisizione, con audio di sistema: la prova dinamica di ciò che l'operatore ha visto e fatto.

evidence/video/

Intercettazione di rete (HAR)

HTTP Archive W3C: registrazione completa di richieste/risposte, header reali, timing e payload. Più requests/responses/resources in JSON e statistiche.

network/network.har

DNS · WHOIS · Traceroute

Risoluzione DNS, interrogazione del registro WHOIS (titolare e dati di registrazione del dominio) e mappa degli hop di rete dal client all'host.

network/dns-lookup.txt · whois.txt · traceroute.txt

Certificati SSL/TLS

Le catene X.509 complete (leaf + intermedi + root, in PEM e leggibili) di ogni host contattato durante l'acquisizione, con i dettagli del certificato.

tls/certificates/

Cookie e stato JavaScript

Tutti i cookie attivi con metadati (HttpOnly, Secure, SameSite, scadenza) e lo snapshot di session storage / local storage al momento della cattura.

network/cookies-detailed.json · evidence/javascript-state/

Interazioni utente

Registrazione di clic, scroll, input e tasti durante la navigazione (catena di custodia delle azioni dell'operatore).

evidence/interactions/user-interactions.json

Mappa delle risorse

La site-structure completa: ogni risorsa (CSS, JS, font, immagini) salvata e organizzata per host, con i metadati di provenienza di ciascuna.

resources/site-structure/

Completezza della cattura

Un rapporto che dichiara, in modo onesto, quante risorse sono state viste, catturate, recuperate via sessione e quante restano irrecuperabili, con la percentuale.

network/completeness-report.json

Report forense

Il rapporto in PDF e TXT (operatore, scope, IP, NTP, SSL, inventario, dichiarazioni forensi) con la propria marca temporale RFC 3161 (report.tsr).

reports/report.pdf · report.txt · report.tsr

Inventario hash

L'elenco di ogni file con la quaterna di hash crittografici, base della verifica di integrità ripetibile da chiunque, anche offline.

hashes/file-hashes.json

Piattaforme sociali

I commenti sono prova. Vanno presi dove stanno.

Su un post, la diffamazione o la minaccia spesso non è nel contenuto: è nei commenti sotto.

I commenti però non sono nella pagina. Compaiono a poco a poco mentre si scorre, si nascondono dietro un «mostra altre risposte», e la piattaforma ne tiene a schermo solo una manciata alla volta. Uno strumento che fotografa lo schermo raccoglie quello che si vede in quel momento: il resto non esiste, e non risulta nemmeno che manchi.

C.E.R.T.O. interroga la stessa sorgente dati che la piattaforma usa per costruire la pagina e conserva ogni risposta ricevuta così com'è arrivata, con la sua busta di provenienza: indirizzo interrogato, metodo, esito, momento della ricezione. Il testo dei commenti, l'autore, il numero di «mi piace» e la data non vengono letti dallo schermo — vengono dal servizio, come li dichiara il servizio.

Le risposte non arrivano insieme all'elenco: ogni commento che ne ha porta una propria continuazione, che va seguita a parte. C.E.R.T.O. le segue, e quando un elenco si esaurisce lo dichiara — con il motivo.

Instagram

Commenti di post e reel. Profilo con la griglia dei contenuti, caroselli compresi. Storie, con isolamento del contenuto scelto. Elenchi di follower e seguiti.

social/instagram/ · raw-api/

Facebook

Commenti. Profilo. Post del diario. Elenco amici, con identificativo e immagine di ciascuno.

social/facebook/ · raw-api/

TikTok

Commenti di video e contenuti fotografici. Il video stesso, scaricato come file autonomo con la propria impronta. Profilo e contenuti pubblicati.

social/tiktok/ · evidence/video-resources/

X (Twitter)

Post con le risposte, seguite pagina dopo pagina fino in fondo. Profilo con i contenuti pubblicati, metriche e immagine.

social/x/ · raw-api/

YouTube

Commenti e risposte di video e short, distinti per livello. Canale con tutte le anteprime in qualità piena. Il filmato scaricato a parte.

youtube-comments/ · raw-api/

Messenger e Direct

Conversazioni private di Messenger e Instagram Direct, estratte senza doverle scorrere a schermo una per una.

social/messaging/

La risposta grezza resta nel fascicolo

Ogni risposta del servizio è conservata verbatim in raw-api/ con la sua busta di provenienza. Chi contesta il dato può risalire alla fonte, non deve fidarsi della nostra tabella.

Il documento dichiara i limiti

Quanti elementi la piattaforma dichiara, quanti ne sono stati raccolti, da quale canale e perché la raccolta si è fermata. Una raccolta incompleta viene detta, non nascosta.

Le date come le dice la piattaforma

Molte piattaforme non dichiarano una data assoluta ma una distanza dal presente («7 giorni fa»). Il valore è riportato come ricevuto: convertirlo sarebbe una nostra interpretazione, non un dato.

Il fascicolo si consulta

Migliaia di messaggi, e quello che cerchi in tre secondi.

Centinaia di commenti e decine di autori: un elenco stampato non serve a nessuno.

Il cruscotto interactive.html incluso nel fascicolo presenta commenti e risposte in tabelle vere, dove si cerca e si ordina. Funziona offline, con un doppio clic, anche fra anni e anche su un computer che non ha C.E.R.T.O. installato.

  • Ricerca nel testo del messaggio, nel nome dell'autore e per identificativo. Il conteggio dei risultati si aggiorna mentre si scrive.
  • Ordinamento su ogni colonna: autore, tipo, data, «mi piace», testo. Le date relative si ordinano nel verso giusto, dal più recente.
  • Commenti e risposte distinti: si vede a colpo d'occhio che cosa è una replica e sotto quale messaggio sta.
  • Schermate dei commenti: la galleria degli scatti raccolti durante l'estrazione, più un PDF unico che riporta l'impronta di ogni immagine e del PDF stesso.
  • Pagina Media: tutte le immagini dell'acquisizione con MD5, SHA-1 e SHA-256, provenienza dichiarata e ricerca anche per impronta.
  • Avvertenze metodologiche a portata di mano ma non d'ingombro: si aprono da un richiamo, raggruppate per argomento.
Onestà tecnica

Che cosa l'archivio restituisce, e che cosa no.

Su un sito tradizionale la riproduzione è fedele. Su un'applicazione c'è un limite, ed è giusto spiegarlo.

L'archivio WACZ conserva le risorse con l'indirizzo con cui sono state chieste, così la pagina si rimonta com'era: struttura, fogli di stile, caratteri, immagini. Con X, Instagram, Facebook o TikTok il discorso cambia — il limite non è nostro, e nessuno strumento oggi lo supera.

Perché un'applicazione non si riproduce

Alla riproduzione il codice del sito viene rieseguito: ridisegna la pagina da capo e chiede al servizio dati che, nell'archivio, non ci sono — perché nessuno li aveva chiesti in quel momento. Il risultato è una pagina che si lamenta, non una pagina falsa.

Per questo c'è l'istantanea

Accanto alla cattura di rete, l'archivio contiene la pagina come l'operatore l'ha vista, senza codice eseguibile: non si riscrive da sola perché non ha nulla da eseguire. Accanto al file c'è una spiegazione bilingue di che cosa è l'una e che cosa è l'altra.

Il filmato non si riproduce — e si scarica

I flussi video viaggiano con indirizzi firmati e a scadenza, e il lettore pretende una risposta viva dal servizio: nessun archivio può riprodurli, nemmeno conservandone i byte. C.E.R.T.O. scarica il filmato a parte, come file autonomo con la propria impronta.

Nessuna di queste cose toglie valore alla prova. Il contenuto è nel fascicolo tre volte, per strade indipendenti: nella risposta grezza del servizio, nelle schermate raccolte durante l'estrazione, e nell'archivio della pagina. Ognuna ha la propria impronta, e le tre si confermano a vicenda. Un archivio che non si riproduce non è un archivio vuoto: contiene ciò che è passato in rete in quel momento, indirizzo per indirizzo.

Auto-validazione

Un fascicolo che si verifica da solo.

Il fascicolo non richiede C.E.R.T.O. per essere validato: chiunque, anche fra anni, può verificarne l'autenticità con strumenti standard. La struttura BagIt 1.0 e il cruscotto interattivo lo rendono auto-esplicativo.

  • index-interactive.html — il cruscotto offline navigabile del fascicolo: riepilogo, pagine visitate, screenshot, video, rete, certificati, completezza, inventario hash e verifica integrità lato client.
  • manifest.json firmato Ed25519 (RFC 8032), legato all'identità del dispositivo registrato al primo avvio.
  • Doppia marca RFC 3161: ancora interna su data/tsa.tsr e sigillo esterno su tagmanifest-sha256.txt.tsr. Cascata gratuita Sectigo→DigiCert→GlobalSign; InfoCert qualificata eIDAS opzionale.
  • manifest-sha256.txt e tagmanifest-sha256.txt (RFC 8493): fixity del payload e dei file di controllo; nessun file può essere aggiunto o alterato senza che la verifica fallisca.
  • metadata/evidence.case.jsonld — descrizione CASE 1.3 / UCO 1.4 della prova, e tsa-ca.pem per la verifica della marca anche offline.
  • verify.sh / verify.bat — verificatori autonomi: ricalcolano gli hash, controllano la doppia marca e la firma, e dichiarano «BUNDLE VALIDO».
FAQ

Domande frequenti

Acquisizione forense di pagine web, validità della prova, formato WACZ e verifica del fascicolo: le domande più comuni.

Cos'è l'acquisizione forense di una pagina web?
È la cattura di una pagina web nello stato esatto in cui appare in un dato momento — contenuti, codice, risorse, traffico di rete e certificati — sigillata crittograficamente in modo che possa essere usata come prova digitale e verificata da terzi.
Che differenza c'è tra uno screenshot e un'acquisizione forense?
Uno screenshot è solo un'immagine, facilmente manipolabile e priva di contesto. L'acquisizione forense di C.E.R.T.O. raccoglie anche l'HTML reso, l'archivio WACZ navigabile, il traffico HTTP (HAR), i certificati TLS, gli hash crittografici e una doppia marca temporale RFC 3161, con catena di custodia verificabile.
L'acquisizione è valida come prova in giudizio?
Il fascicolo è prodotto secondo standard riconosciuti (ISO/IEC 27037, BagIt RFC 8493, RFC 3161, CASE/UCO) con firma Ed25519 e doppia marca temporale. La sua autenticità e integrità sono verificabili da chiunque, anche offline, rendendolo idoneo all'uso peritale e processuale. La valutazione finale spetta sempre all'autorità giudicante.
Cos'è un archivio WACZ?
WACZ (Web Archive Collection Zipped, basato su WARC / ISO 28500) è un formato standard che racchiude l'intera navigazione — pagine, risorse e traffico — in un unico file auto-contenuto, riproducibile offline byte per byte con ReplayWeb.page.
Come si verifica l'autenticità del fascicolo?
Ogni fascicolo contiene verify.sh / verify.bat e un cruscotto index-interactive.html: ricalcolano gli hash, controllano la firma Ed25519 e la doppia marca RFC 3161 e dichiarano se il bundle è valido. La verifica non richiede C.E.R.T.O. né una connessione a Internet.
C.E.R.T.O. acquisisce i commenti di un post social?
Sì, ed è spesso la parte che conta: su Instagram, Facebook, TikTok, X e YouTube i commenti — e le risposte ai commenti — vengono raccolti interrogando la stessa sorgente dati che la piattaforma usa per costruire la pagina, non fotografando lo schermo. Ogni risposta del servizio resta nel fascicolo così com'è arrivata, con l'indirizzo interrogato e il momento della ricezione. Il documento dichiara quanti elementi la piattaforma annuncia, quanti ne sono stati raccolti e perché la raccolta si è fermata.
Come si ritrova un messaggio fra centinaia di commenti?
Il cruscotto interactive.html incluso nel fascicolo presenta commenti e risposte in tabelle con ricerca sul testo, sull'autore e per identificativo, e ordinamento su ogni colonna. Funziona offline, con un doppio clic, anche su un computer che non ha C.E.R.T.O. installato. Ci sono inoltre la galleria delle schermate raccolte durante l'estrazione, con un PDF che ne riporta le impronte, e una pagina con tutte le immagini dell'acquisizione ricercabili anche per impronta.
Perché l'archivio WACZ di un social non si riproduce come il sito originale?
Perché alla riproduzione il codice del sito viene rieseguito: ridisegna la pagina da capo e chiede al servizio dati che nell'archivio non ci sono, perché in quel momento nessuno li aveva chiesti. È un limite del formato di fronte alle applicazioni, non di C.E.R.T.O., e nessuno strumento oggi lo supera. Per questo l'archivio contiene anche un'istantanea della pagina come l'operatore l'ha vista, senza codice eseguibile, con accanto una spiegazione bilingue. Il contenuto resta comunque nel fascicolo per tre strade indipendenti: la risposta grezza del servizio, le schermate e l'archivio stesso.
Il video di un post viene acquisito?
Sì, ma non dentro l'archivio della pagina: i flussi video viaggiano con indirizzi firmati e a scadenza e nessun archivio può riprodurli. C.E.R.T.O. scarica il filmato a parte, come file autonomo con la propria impronta crittografica, così resta riproducibile con qualsiasi lettore anche fra anni.
Quali contenuti vengono acquisiti?
Screenshot del viewport e a pagina intera, snapshot del DOM dopo l'esecuzione del JavaScript, archivio WACZ, video della sessione, traffico di rete HAR, DNS/WHOIS/traceroute, certificati SSL/TLS, cookie e stato JavaScript, interazioni dell'utente, mappa delle risorse e report forense in PDF, con inventario completo degli hash.

Raccogli prove con il modulo Pagine web.

Registrati gratis e scarica C.E.R.T.O. Desktop per Windows e macOS dalla tua area riservata.