Cantieri aperti: differenze tra le versioni
| [versione verificata] | [versione verificata] |
handoff automatico |
handoff automatico |
||
| Riga 7: | Riga 7: | ||
== Cantieri attivi == | == Cantieri attivi == | ||
=== censimento-biblioteca === | === censimento-biblioteca === | ||
''Aggiornato 2026-09-16 23: | ''Aggiornato 2026-09-16 23:27 UTC'' — dominio: biblioteca | ||
; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree | ; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree | ||
| Riga 25: | Riga 16: | ||
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti). | * v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti). | ||
* v_catalogo + catalogo_struttura (sha_testo: 494 famiglie dup esatti) + catalogo_crabtree_match (600 Crabtree agganciati). prime_pagine.py: PDF Drive (5154, job _prime_pagine_full). prime_pagine_fonti.py: archive.org via _djvu.xml, IAPSOP via URL archive/materials/{rivista}/{file}, Gallica via f1n10.pdf a 12s (429=ritenta): jobs _prime_pagine_ia/_iapsop/_gallica, tutti su biblioteca.prime_pagine, stato in censimento_bib/prime_pagine_*_state.json. Non coperti: Wellcome (428), Gallica sul PC di Marco. | * v_catalogo + catalogo_struttura (sha_testo: 494 famiglie dup esatti) + catalogo_crabtree_match (600 Crabtree agganciati). prime_pagine.py: PDF Drive (5154, job _prime_pagine_full). prime_pagine_fonti.py: archive.org via _djvu.xml, IAPSOP via URL archive/materials/{rivista}/{file}, Gallica via f1n10.pdf a 12s (429=ritenta): jobs _prime_pagine_ia/_iapsop/_gallica, tutti su biblioteca.prime_pagine, stato in censimento_bib/prime_pagine_*_state.json. Non coperti: Wellcome (428), Gallica sul PC di Marco. | ||
* Censiti perfettamente 1809 su 11019 libri veri (16%) | |||
* bibliografico minimo 5262 (48%). v_catalogo + catalogo_struttura (494 famiglie dup esatti) + catalogo_crabtree_match (600 agganciati). Prime pagine da 4 fonti: PDF Drive, archive.org (djvu.xml), IAPSOP (URL ricostruito), Gallica (f1n10.pdf, lento per i 429). Fase 2 frontespizio_meta.py: regex su prime_pagine -> biblioteca.frontespizio_meta con validazione stretta (fix_front.py: autore >=2 token non geografici, editore senza boilerplate, anno non da copyright recente) e merge nel corpus SOLO dei valori validati e SOLO sui campi vuoti | |||
* struttura editoriale codificata b<bianche>-f<pag frontespizio>-toc/notoc (dominante b0-f1-notoc 88%). ASINCRONO: censimento_prosegui.py in cron */20 rilancia le corse cadute e a corse finite lancia la fase frontespizio (flag censimento_bib/fase_frontespizio.done). | |||
; Prossimo passo : | ; Prossimo passo : | ||
* AUTO: | * AUTO: tutto e in cron */20 via censimento_prosegui.py, log in logs/censimento_prosegui.log | ||
* | * a fase frontespizio conclusa: misurare di nuovo i livelli di completezza e proporre a Marco DeepSeek diretto solo sui meta_status NULL restanti (~7 USD) | ||
* indici/sommari: estrarre il TOC dai doc con toc_nelle_prime=TRUE | |||
* | * Wellcome (428 doc) via IIIF | ||
* dedup 45 doc_id doppi in corpus | * dedup 45 doc_id doppi in corpus | ||
* Gallica dal PC di Marco: se li carica in Drive entrano dal flusso PDF | |||
=== memoria-retrieval-eval === | |||
''Aggiornato 2026-09-16 23:26 UTC'' — dominio: memoria | |||
; Obiettivo : misurare recall@1/@5 e MRR della memoria CC e decidere sui dati se serve uno strato semantico | |||
; Fatto (con prova) : | |||
* memoria_eval.py in scripts/, misura eseguita, report gs://isicnv-command-center-routes/state/memoria_eval/latest.json | |||
; Prossimo passo : | |||
* python3 /home/claudeuser/scripts/memoria_eval.py --n=40 | |||
=== chat-s20260908-dipisafermo-1ol47hs === | === chat-s20260908-dipisafermo-1ol47hs === | ||