What happened: digitisation for AI training raises concerns about destruction of original books
Indian coders and professionals working in coding and digitisation workflows say book digitisation supports large-scale AI training because digitised text can be used as machine-readable training data. At the same time, they raise concerns about digitisation workflows that include destruction of original physical books after digitisation. Their concerns focus on compliance (lawful use), provenance (traceable origin and rights/permission status), and preservation (long-term safeguarding of knowledge sources).
Background and earlier position: dataset availability depends on digitised content and lawful rights status
What changed now: the focus shifts from digitise-only to digitise-and-destroy
Indian coders emphasise an additional governance decision point in digitisation workflows: whether destroying original physical copies after digitisation undermines preservation and provenance/auditability goals. Digitised copies can enable AI training at scale. However, destruction of originals can reduce long-term preservation options and can make later verification harder if provenance documentation is incomplete.
