Cantieri aperti: differenze tra le versioni
| [versione verificata] | [versione verificata] |
handoff automatico |
handoff automatico |
||
| Riga 8: | Riga 8: | ||
== Cantieri attivi == | == Cantieri attivi == | ||
=== censimento-biblioteca === | === censimento-biblioteca === | ||
''Aggiornato 2026-09-16 | ''Aggiornato 2026-09-16 23:14 UTC'' — dominio: biblioteca | ||
; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree | ; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree | ||
| Riga 15: | Riga 15: | ||
* corpus_meta/corpus_meta2 tabelle di passaggio. Piano censimento-biblioteca (SQL in /home/claudeuser/censimento_bib/): catalogo_struttura + v_catalogo + riepilogo.csv, job censimento-biblioteca_run2. Il corpus ha perso i confini di pagina (form feed solo su 6258 doc): prime-10-pagine/pagine-bianche vanno fatte sui PDF Drive. | * corpus_meta/corpus_meta2 tabelle di passaggio. Piano censimento-biblioteca (SQL in /home/claudeuser/censimento_bib/): catalogo_struttura + v_catalogo + riepilogo.csv, job censimento-biblioteca_run2. Il corpus ha perso i confini di pagina (form feed solo su 6258 doc): prime-10-pagine/pagine-bianche vanno fatte sui PDF Drive. | ||
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti). | * v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti). | ||
* v_catalogo + catalogo_struttura (sha_testo: 494 famiglie dup esatti) + catalogo_crabtree_match (600 Crabtree agganciati). prime_pagine.py: PDF Drive (5154, job _prime_pagine_full). prime_pagine_fonti.py: archive.org via _djvu.xml, IAPSOP via URL archive/materials/{rivista}/{file}, Gallica via f1n10.pdf a 12s (429=ritenta): jobs _prime_pagine_ia/_iapsop/_gallica, tutti su biblioteca.prime_pagine, stato in censimento_bib/prime_pagine_*_state.json. Non coperti: Wellcome (428), Gallica sul PC di Marco. | |||
; Prossimo passo : | ; Prossimo passo : | ||
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento- | * AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_ia | ||
* AUTO | * AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_iapsop | ||
* a | * AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_gallica | ||
* DeepSeek diretto | * job caduto: rilanciare stesso comando con id _2 (riprende dallo stato) | ||
* dedup | * a corse finite: regex frontespizio su prime_pagine.testo_frontespizio + strutture editoriali per epoca | ||
* Wellcome via IIIF | |||
* DeepSeek diretto sui meta_status NULL restanti (~7 USD, via di Marco) | |||
* dedup 45 doc_id doppi in corpus | |||
=== chat-s20260908-dipisafermo-1ol47hs === | === chat-s20260908-dipisafermo-1ol47hs === | ||