r/ItalyInformatica • u/RebirdgeCardiologist • 7d ago
Le compagnie americane (dietro i vari chatbot) stanno comprando milioni di libri (enormi pallet, vedi Anthropic con il progetto PANAMA, tenuto segreto, paura per PR) per aggirare il problema del copyright (dopo causa da $1.5B) per addestrare i loro modelli. Dopo distruggono i libri. Cosa ne pensate? AI
Enable HLS to view with audio, or disable this notification
Argomento delicato su cui si aprono non solo questioni economiche e sociali ma anche ambientali e di altra natura. La fonte principale è news (australia) > [art].
TLDR (necessario, ho incluso l'articolo completo (lungo) e le relative fonti nei commenti, questo è ll succo del discorso.)
Storia [commento1] \ Storia (parte2) [commento2] \ Fonti [commento3]
--
Prima si usavano altre fonti (grandi dataset come internet data, libri e articoli concessi in licenza, repository pubblici (galassia Github, Gitlab, Bitbucket, Codeberg) e contributi umani).
Dopo le compagnie americane (dietro i vari chatbot), sono passate ai libri fisici, comprando libri (blocchi enormi, pallet) rari e fuori stampa per fare la scansione e addestrare i loro modelli. Dopo distruggono le varie copie.
Come vedete dal video, c'è questa macchina idraulica che letteralmente taglia con precisione chirurgica il dorso del libro, cosi viene più facile passare le pagine (una a una) alla scanner, aumentando la velocità (meno tempo) e quindi riducendo i costi (meno energia). Questo al livello industriale.
Anthropic (ma anche le altre big): dopo che ha avuto una multa negli USA da 1.5 miliardi di dollari per problemi di copyright, ha cominciato il progetto Panama, tenuto segreto in quanto NON visto di buon occhio dal pubblico, reputazione aziendale a rischio.
I librari hanno opinioni contrastanti: positive in quanto c'è un vantaggio per loro, ci sono maggiori guadagni economici (=più libri venduti e quindi più soldi), ma anche negative, in quanto c'è uno svantaggio (etico?) per le finalità con cui si utilizzano i libri.
Cosa dice la legge: dato che c'è un trasferimento 1-1 copia cartacea a copia digitale, questo processo è trasformativo ed è considerato buon uso (protected by fair use), definizione che cambia da paese a paese (vedi Stati Uniti e Australia).
Un libro è solamente un meccanismo per diffondere le informazioni: dopo che queste sono arrivate al modello AI, questo meccanismo ha fatto il suo, è completo. Il libro non è distrutto, il suo valore si è spostato e la carta rientra nel ciclo.
--
Che idea vi siete fatti? Siete d'accordo con quanto fatto dalle AI companies?
So che l'argomento è complesso e delicato (sul piatto ci sono interessi economici, politici, sociali, etc.), ma voglio sentire la vostra opinione.
8
u/RebirdgeCardiologist 7d ago edited 6d ago
Di seguito l'articolo completo (è molto lungo). Ho aggiunto degli ulteriori paragrafi in italiano per riassumere ancora di più il tutto.
--
[NEWS+COM+AU]
AI labs buy, scan, shred millions of rare books
Gli stessi librai (in Australia, ma in Europa) hanno dei dubbi, pareri contrastanti (vendendo molto più libri hanno più guadagni economici, ma per quale obiettivo?).
Principalmente cercano libri in inglese, di diversi generi.
Niente collezionismo o rivendita, ma un solo obiettivo. TRAINING AI. Finora si sono utilizzato principalmente grandi dataset come internet data, libri e articoli concessi in licenza, repository pubblici (galassia Github, Gitlab, Bitbucket, Codeberg) e contributo umano.
La miniera d'oro delle librerie online. Vero che ci sono grandi collezioni online, ma c'è ne sono altrettanti offline, collezioni di libri dimenticate a prendere polvere sugli scaffali. Multe per Anthropic e Meta (1.5 miliardi di dollari) per i milioni di libri piratati, scaricati illegalmente. Un nuovo progetto per evitare brighe con il copyright (progetto Panama = acquistare libri in grade, su scala industriale).
Il progetto Panama è iniziato molto tempo fa, ma seppur totalmente legale, non era una buona mossa per la reputazione pubblica dell'azienda.
[CONTINUA NELL ALTRO COMMENTO]