Cantieri aperti: differenze tra le versioni

[versione verificata][versione verificata]
WikiBot (discussione | contributi)
handoff automatico
WikiBot (discussione | contributi)
handoff automatico
Riga 7: Riga 7:


== Cantieri attivi ==
== Cantieri attivi ==
=== memoria-retrieval-eval ===
''Aggiornato 2026-09-16 23:26 UTC'' — dominio: memoria
; Obiettivo : misurare recall@1/@5 e MRR della memoria CC e decidere sui dati se serve uno strato semantico
; Fatto (con prova) :
* memoria_eval.py in scripts/, misura eseguita, report gs://isicnv-command-center-routes/state/memoria_eval/latest.json
; Prossimo passo :
* python3 /home/claudeuser/scripts/memoria_eval.py --n=40
=== censimento-biblioteca ===
=== censimento-biblioteca ===
''Aggiornato 2026-09-16 23:14 UTC'' — dominio: biblioteca
''Aggiornato 2026-09-16 23:27 UTC'' — dominio: biblioteca


; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree
; Obiettivo : Censimento completo Biblioteca Magnetica: megaindice con metadati, indice e prime pagine per ogni libro, dedup, collegamento Crabtree
Riga 25: Riga 16:
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti).
* v_catalogo (megaindice) + catalogo_struttura con sha_testo (494 famiglie di duplicati esatti, 1271 doc) + catalogo_crabtree_match (600 voci Crabtree agganciate, 289 forti). prime_pagine.py (scripts/) legge le prime 10 pagine dei PDF da Drive in streaming: pilota 100 ok, corsa completa job censimento-biblioteca_prime_pagine_full -> biblioteca.prime_pagine (stato in censimento_bib/prime_pagine_state.json, riprende da solo). Trovati 45 doc_id doppi in corpus (17695 righe, 17650 distinti).
* v_catalogo + catalogo_struttura (sha_testo: 494 famiglie dup esatti) + catalogo_crabtree_match (600 Crabtree agganciati). prime_pagine.py: PDF Drive (5154, job _prime_pagine_full). prime_pagine_fonti.py: archive.org via _djvu.xml, IAPSOP via URL archive/materials/{rivista}/{file}, Gallica via f1n10.pdf a 12s (429=ritenta): jobs _prime_pagine_ia/_iapsop/_gallica, tutti su biblioteca.prime_pagine, stato in censimento_bib/prime_pagine_*_state.json. Non coperti: Wellcome (428), Gallica sul PC di Marco.
* v_catalogo + catalogo_struttura (sha_testo: 494 famiglie dup esatti) + catalogo_crabtree_match (600 Crabtree agganciati). prime_pagine.py: PDF Drive (5154, job _prime_pagine_full). prime_pagine_fonti.py: archive.org via _djvu.xml, IAPSOP via URL archive/materials/{rivista}/{file}, Gallica via f1n10.pdf a 12s (429=ritenta): jobs _prime_pagine_ia/_iapsop/_gallica, tutti su biblioteca.prime_pagine, stato in censimento_bib/prime_pagine_*_state.json. Non coperti: Wellcome (428), Gallica sul PC di Marco.
* Censiti perfettamente 1809 su 11019 libri veri (16%)
* bibliografico minimo 5262 (48%). v_catalogo + catalogo_struttura (494 famiglie dup esatti) + catalogo_crabtree_match (600 agganciati). Prime pagine da 4 fonti: PDF Drive, archive.org (djvu.xml), IAPSOP (URL ricostruito), Gallica (f1n10.pdf, lento per i 429). Fase 2 frontespizio_meta.py: regex su prime_pagine -> biblioteca.frontespizio_meta con validazione stretta (fix_front.py: autore >=2 token non geografici, editore senza boilerplate, anno non da copyright recente) e merge nel corpus SOLO dei valori validati e SOLO sui campi vuoti
* struttura editoriale codificata b<bianche>-f<pag frontespizio>-toc/notoc (dominante b0-f1-notoc 88%). ASINCRONO: censimento_prosegui.py in cron */20 rilancia le corse cadute e a corse finite lancia la fase frontespizio (flag censimento_bib/fase_frontespizio.done).
; Prossimo passo :
; Prossimo passo :
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_ia
* AUTO: tutto e in cron */20 via censimento_prosegui.py, log in logs/censimento_prosegui.log
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_iapsop
* a fase frontespizio conclusa: misurare di nuovo i livelli di completezza e proporre a Marco DeepSeek diretto solo sui meta_status NULL restanti (~7 USD)
* AUTO: python3 /home/claudeuser/scripts/job.py --status censimento-biblioteca_prime_pagine_gallica
* indici/sommari: estrarre il TOC dai doc con toc_nelle_prime=TRUE
* job caduto: rilanciare stesso comando con id _2 (riprende dallo stato)
* Wellcome (428 doc) via IIIF
* a corse finite: regex frontespizio su prime_pagine.testo_frontespizio + strutture editoriali per epoca
* Wellcome via IIIF
* DeepSeek diretto sui meta_status NULL restanti (~7 USD, via di Marco)
* dedup 45 doc_id doppi in corpus
* dedup 45 doc_id doppi in corpus
* Gallica dal PC di Marco: se li carica in Drive entrano dal flusso PDF
=== memoria-retrieval-eval ===
''Aggiornato 2026-09-16 23:26 UTC'' &mdash; dominio: memoria
; Obiettivo : misurare recall@1/@5 e MRR della memoria CC e decidere sui dati se serve uno strato semantico
; Fatto (con prova) :
* memoria_eval.py in scripts/, misura eseguita, report gs://isicnv-command-center-routes/state/memoria_eval/latest.json
; Prossimo passo :
* python3 /home/claudeuser/scripts/memoria_eval.py --n=40


=== chat-s20260908-dipisafermo-1ol47hs ===
=== chat-s20260908-dipisafermo-1ol47hs ===