Cantieri aperti: differenze tra le versioni

[versione verificata][versione verificata]
WikiBot (discussione | contributi)
handoff automatico
WikiBot (discussione | contributi)
handoff automatico
Riga 8: Riga 8:
== Cantieri attivi ==
== Cantieri attivi ==
=== censimento-biblioteca ===
=== censimento-biblioteca ===
''Aggiornato 2026-09-16 22:50 UTC'' — dominio: biblioteca
''Aggiornato 2026-09-16 23:14 UTC'' — dominio: biblioteca


; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree
; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree
Riga 15: Riga 15:
* corpus_meta/corpus_meta2 tabelle di passaggio. Piano censimento-biblioteca (SQL in /home/claudeuser/censimento_bib/): catalogo_struttura + v_catalogo + riepilogo.csv, job censimento-biblioteca_run2. Il corpus ha perso i confini di pagina (form feed solo su 6258 doc): prime-10-pagine/pagine-bianche vanno fatte sui PDF Drive.
* corpus_meta/corpus_meta2 tabelle di passaggio. Piano censimento-biblioteca (SQL in /home/claudeuser/censimento_bib/): catalogo_struttura + v_catalogo + riepilogo.csv, job censimento-biblioteca_run2. Il corpus ha perso i confini di pagina (form feed solo su 6258 doc): prime-10-pagine/pagine-bianche vanno fatte sui PDF Drive.
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti).
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti).
* v_catalogo + catalogo_struttura (sha_testo: 494 famiglie dup esatti) + catalogo_crabtree_match (600 Crabtree agganciati). prime_pagine.py: PDF Drive (5154, job _prime_pagine_full). prime_pagine_fonti.py: archive.org via _djvu.xml, IAPSOP via URL archive/materials/{rivista}/{file}, Gallica via f1n10.pdf a 12s (429=ritenta): jobs _prime_pagine_ia/_iapsop/_gallica, tutti su biblioteca.prime_pagine, stato in censimento_bib/prime_pagine_*_state.json. Non coperti: Wellcome (428), Gallica sul PC di Marco.
; Prossimo passo :
; Prossimo passo :
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_full
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_ia
* AUTO se caduto: python3 /home/claudeuser/scripts/job.py --run "python3 /home/claudeuser/scripts/prime_pagine.py" --id censimento-biblioteca_prime_pagine_full2
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_iapsop
* a corsa finita: regex frontespizio su prime_pagine.testo_frontespizio (autore/titolo/anno/editore/luogo deterministici) e classificazione strutture editoriali per epoca
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_gallica
* DeepSeek diretto solo sui doc con meta_status NULL restanti (circa 7 USD, serve via di Marco)
* job caduto: rilanciare stesso comando con id _2 (riprende dallo stato)
* dedup dei 45 doc_id doppi in corpus
* a corse finite: regex frontespizio su prime_pagine.testo_frontespizio + strutture editoriali per epoca
* Wellcome via IIIF
* DeepSeek diretto sui meta_status NULL restanti (~7 USD, via di Marco)
* dedup 45 doc_id doppi in corpus


=== chat-s20260908-dipisafermo-1ol47hs ===
=== chat-s20260908-dipisafermo-1ol47hs ===