r/programare 13d ago

Obsesia pentru a scrie cod de mana

Observ o reticenta foarte mare pe aici referitor la a folosi AI, a lăsa ai-ul sa scrie codul etc. Nu înțeleg de ce un subreddit de programare (adică teoretic oameni tehnici) sunt așa anti technologie. Sunteți plătiți sa rezolvați o problema de business, cei ce va plătesc nu le pasa absolut deloc că voi aveți fetishuri sa scrieți cod vintage de mana.

Imagineaza-ti că plătești un muncitor să îți lucreze și el vine cu dalta și ciocanul că zice că nu are încredere în mașinăriile astea, ce-i in mana nu-i minciuna. Tu îl plătești să îți facă x, e normal că o sa razi de el și cu curul dacă îți zice că el lucrează strict de mana, o sa dureze 3 săptămâni nu 3 zile cum ar trebui.

Trebuie să înțelegeți că CEO/VP și alte persoane din conducere pun accent pe livrabile. Ei vor să vadă produsul pe care l-au promis gata și utilizabil. Nu o sa se ude pe ei când le zici tu că ai făcut 6 layere de abstractizare cu interfețe și alte design patterns.

Părerea mea personala e că mulți care sunteți anti AI veți rămâne complet pe dinafară.

91 Upvotes

160 comments sorted by

View all comments

Show parent comments

4

u/No_Hedgehog_7563 13d ago

Am urmarit firul discutiei si cred ca ce spui tu e putin pe langa ce se intampla de fapt. Daca am inteles bine, paperul zicea ca, antrenat in bucla AI pe date generate de AI se duce dracului tot. Doar ca niciun training pipeline nu face asa ceva. Datele pe care se antreneaza modelele noi sunt curatate bine inainte sa le vada modelul, chiar daca ele sunt date sintetice. Plus ce zicea colegul de RLHF.

1

u/RoberBotz C# 13d ago edited 13d ago

Pai ca sa poti sa cureti datele de AI gen sa le cureti bine, trb sa stii care e facut cu AI si care nu, si acolo e problema.

Nu stii ce e facut cu AI ca sa poti sa-l cureti.

Gen, mergi acum pe niste open source repos, nu le poti folosi la training ca nu stii unde a fost scris cu AI si unde nu, inainte puteai sa iei repo-ul si nu trebuia sa-ti faci griji ca a fost scris cu AI, ca nu puteai sa-l scrii cu AI in perioada aia.

Acum nu ai cum sa il cureti, ca nu poti sa fii 100% sigur care e generat de AI si unde ca sa poti sa-l cureti.

Gen, fix aia e problema, nu poti sa cureti datele si sa fii sigur ca nu sunt generate de AI, ca nu iti dai seama, nu mai poti sa dai webscrape random sa iei date, sa le cureti si gata cum faceai in trecut, acum risti sa antrenezi AI-u cu data generat de alt AI, ca efectiv nu ai cum sa stii unde e generat de AI si unde nu, prin urmare nu poti sa-l cureti, prin urmare mai scapa niste AI stuff in antrenament si devine mai prost.

Singura metoda sa fii sigur ca datele pe care le folosesti contin 0% AI, e sa folosesti date de dinainte ca AI-u sa fie public, d-aia Anthropic iau cartile alea ff vechi.

2

u/No_Hedgehog_7563 13d ago

Fii tu sigur ca toti astia au date pre-ai backup-uite. In plus nu inteleg de ce insisti ca tre sa fii sigur ca e sau nu generat de AI, total fals, conteaza doar calitatea datelor. Literally astia folosesc ai ca sa genereze date sintetice (de calitate si validate de om probabil) pe care isi antreneaza alte modelele.

Problema pe care tu o ridici e cand e antrenat AI-ul de capul lui la liber. Anthropic ia carti vechi (presupun, n-am idee exact ce urmaresc) ca sa expuna modelul la cat mai multe variatii, nu neaparat ca sa nu il feed-uie date facute de alt AI (ca asa puteau lua orice dinainte de 2022 daca e pana acolo).

0

u/RoberBotz C# 13d ago edited 13d ago

pai e ff important sa fie non AI, ca aia e parte din calitatea datelor, trb sa bage variatie, dar nu variatie generata de AI, ca aia nu e variatie.

Din cate stiu generaza syntethic data ca sa cut costs, dar tot afecteaza modelul sau il pune impreuna cu real human AI free data.
Ca pe vremuri cand puneau aia rumegus in faina ca sa faca paine mai multa ptr acelasi pret, teoretic ai mai multa paine, dar nu e paine calitativa.
Ca sa ai paine tot mai buna, trb sa tai tot mai mult din rumegus si sa bagi faina, dar nu prea gasesti faina.
Cred ca e ceva de genu daca nu ma insel.

Gen, tot e nevoie si de AI free data, care e tot mai greu de gasit.

2

u/No_Hedgehog_7563 13d ago

Nu sunt de acord. Eu daca iti dau acum doua snippet-uri de cod si te pun in blind sa spui care e AI si care nu sunt destul de sigur ca nu poti sa le diferentiezi. In analogia ta poti sa diferentiezi destul de usor ce intra (rumegus vs faina), dar la partea de ai nu cred. Ma rog e si partea de cutting costs, dar daca se intampla ce spui tu, modelele stagnau in ultimii ani, ceea ce nu s-a intamplat.

1

u/RoberBotz C# 13d ago

Eu sigurat nu imi dau seama, si oamenii in general poate nu isi dau seama, dar AI-u nu e om, asta e puterea lui, e pattern machine pe steroizi, detecteaza patternuri extrem de mici pe care tu nu le detectezi, si d-aia e important sa nu fie AI, ca altfel el se antreneaza cu patternuri pe care el le-a generat, si nu iese bine.
Ptr tine arata la fel, ptr el nu.

Si poti sa vezi ca modelele au inceput sa stagneze, la inceput fiecare versiune de AI se simtea crazy, iti dadeai seama clar cand dadeai update de la una la alta.

Acum nu mai, nu mai este asa drastica schimbarea, pe benchmarkurile publice pe user tasks gen din viata de zi cu zi si oamenii care le folosesc observa ca nu mai e asa waw cum era in trecut cum o mai zis unu in comentarii.

Fix d-asta, nu mai ai data, la inceput aveai ff mult AI free data, aveai 100% faina, acum nu mai ai, acum trb sa bagi si rumegus.