Cantieri aperti: differenze tra le versioni

[versione verificata][versione verificata]
WikiBot (discussione | contributi)
handoff automatico
WikiBot (discussione | contributi)
handoff automatico
Riga 7: Riga 7:


== Cantieri attivi ==
== Cantieri attivi ==
=== censimento-biblioteca ===
''Aggiornato 2026-09-16 22:50 UTC'' — dominio: biblioteca
; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree
; Fatto (con prova) :
* Catalogo DeepSeek (lug 2026) gia fuso in biblioteca.corpus: autore 67%, anno 59%, indice 27%, descrizione 74%
* corpus_meta/corpus_meta2 tabelle di passaggio. Piano censimento-biblioteca (SQL in /home/claudeuser/censimento_bib/): catalogo_struttura + v_catalogo + riepilogo.csv, job censimento-biblioteca_run2. Il corpus ha perso i confini di pagina (form feed solo su 6258 doc): prime-10-pagine/pagine-bianche vanno fatte sui PDF Drive.
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti).
; Prossimo passo :
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_full
* AUTO se caduto: python3 /home/claudeuser/scripts/job.py --run "python3 /home/claudeuser/scripts/prime_pagine.py" --id censimento-biblioteca_prime_pagine_full2
* a corsa finita: regex frontespizio su prime_pagine.testo_frontespizio (autore/titolo/anno/editore/luogo deterministici) e classificazione strutture editoriali per epoca
* DeepSeek diretto solo sui doc con meta_status NULL restanti (circa 7 USD, serve via di Marco)
* dedup dei 45 doc_id doppi in corpus
=== chat-s20260908-dipisafermo-1ol47hs ===
=== chat-s20260908-dipisafermo-1ol47hs ===
''Aggiornato 2026-09-16 22:40 UTC'' — dominio: chat_riprese
''Aggiornato 2026-09-16 22:40 UTC'' — dominio: chat_riprese
Riga 59: Riga 74:
; Fatto (con prova) :
; Fatto (con prova) :
* 17/09 fusione dei due audit in uno (analisi cantieri)
* 17/09 fusione dei due audit in uno (analisi cantieri)
=== censimento-biblioteca ===
''Aggiornato 2026-09-16 22:10 UTC'' — dominio: biblioteca
; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree
; Fatto (con prova) :
* Catalogo DeepSeek (lug 2026) gia fuso in biblioteca.corpus: autore 67%, anno 59%, indice 27%, descrizione 74%
* corpus_meta/corpus_meta2 tabelle di passaggio. Piano censimento-biblioteca (SQL in /home/claudeuser/censimento_bib/): catalogo_struttura + v_catalogo + riepilogo.csv, job censimento-biblioteca_run2. Il corpus ha perso i confini di pagina (form feed solo su 6258 doc): prime-10-pagine/pagine-bianche vanno fatte sui PDF Drive.
; Prossimo passo :
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_run2
* sha256 su tutti i doc (oggi 3407/17695)
* prime 10 pagine dai PDF Drive in streaming con pagine bianche -> biblioteca.prime_pagine
* meta deterministici da frontespizio, poi DeepSeek diretto solo sui 4429 meta_status NULL
* join con biblioteca.libri (Crabtree 1899 voci)


=== fabbrica-ingresso-config-vincente ===
=== fabbrica-ingresso-config-vincente ===