(Acest articol a fost publicat pentru prima dată pe https://pacha.dev/blogși cu amabilitate a contribuit la R-bloggeri). (Puteți raporta problema legată de conținutul acestei pagini aici)
Doriți să vă distribuiți conținutul pe R-bloggeri? dați clic aici dacă aveți un blog, sau aici dacă nu aveți.
Înainte de conținutul principal: creez o comunitate R pe Grupuri Google. Vă puteți alătura grupului folosind acest formular.
Cu comentariile recente ale lui Obama despre inteligența artificială, mă gândeam la ceea ce a fost odată inițiativa Guvernului Deschis care, deși remarcabilă în multe sensuri, folosea pentru a confunda datele și informațiile. Asta a fost în 2009 și o mare parte din munca mea a constat din când în când în obținerea de date, acestea sunt valorile care ar putea fi extrase dintr-o bază de date, cum ar fi regiunea, orașul și variabilele de interes furnizate în formate menite să ofere interpretări și să tragă concluzii. Cu alte cuvinte, o parte din munca mea are complicația de a trata datele furnizate în format greșit pentru acest scop, cum este cazul eliberării datelor în format PDF.
Când un economist ca mine accesează un site web guvernamental, cum ar fi USITC, de multe ori el/ea caută date brute, astfel încât acestea să poată fi analizate și modelate în moduri diferite, de obicei detectând inconsecvențele și interpretate în forma de tabele rezumative și diagrame din interiorul unui document. USITC folosește formatele corecte pentru acest scop, dar alte birouri publice tind să insiste asupra formatelor greșite chiar și acum, când AI a devenit o problemă esențială și este adesea percepută ca un instrument multifuncțional.
Partajarea datelor în format PDF va continua să fie o practică obișnuită și, de multe ori, aceasta complică prea mult munca științifică și jurnalismul de investigație, așa cum a fost cazul Dollars for Docs. Proverba populară este că dacă ai un ciocan, atunci totul arată ca un cui. Fluxul de lucru bazat pe inteligență artificială poate crește viteza cu care putem crea un prototip de software și să lucrăm în continuare într-o cultură organizațională care confundă datele și informațiile.
Odată cu creșterea inteligenței artificiale, agențiile guvernamentale pot eficientiza fluxurile de lucru care au ca rezultat un PDF pentru o distribuție eficientă a informațiilor. Informațiile dintr-un document PDF pot fi citite în forma sa electronică, tipărite și redistribuite cu ușurință. Cu toate acestea, adăugarea AI la fluxurile de lucru guvernamentale poate adăuga un element vicios în loc de un element virtuos. Pentru economistul care dorește date brute, PDF-urile realizate mai rapid ca în actualizările mai frecvente este alegerea incorectă. Riscul este ca AI să devină un nou ciocan, un instrument cu care să încercăm să lovim totul în același mod în care continuăm să folosim PDF-uri fără a ne gândi la adecvarea din spatele alegerii tehnologice.
Sunt destul de sigur că multe probleme de date, nu doar în guvern, ci și în afaceri, nu necesită deloc AI. În urmă cu aproximativ cinci ani, un hype mult mai puțin important era despre Machine Learning (ML) și multe comentarii mi-au dat impresia că ML devine un nou ciocan. În special, multe probleme de date, cum ar fi blocajele și organizarea, pot fi rezolvate prin mutarea datelor din mai multe fișiere într-un motor de bază de date SQL (Structured Query Language) adecvat, cum ar fi PostgreSQL sau MariaDB, ambele cu un istoric dovedit.
Datele brute necesită, de asemenea, metadate care descriu intervalul de timp, sursa și descrierile pentru variabilele individuale și mai multe proprietăți importante. Un PDF pare a fi util pentru a oferi un dicționar de date și, la fel, ar putea fi un document Word sau chiar un fișier TXT simplu, ceea ce m-a determinat să mă gândesc la lipsa dezbaterii privind adecvarea AI și a multor alte instrumente. Pentru cazul SQL, este justificat pentru seturi de date brute mari, în care foile de calcul Excel sunt insuficiente și vor exista cazuri în care foaia de calcul Excel va fi potrivită.
Există multe alte formate de date brute care ar putea fi mai potrivite pentru nevoi speciale, cum ar fi fișierele simple de foi de calcul (CSV). Există nevoi specifice, cum este cazul datelor geografice, pentru care avem shapefiles (SHP) pentru păstrarea informațiilor despre caracteristicile spațiale cu versiunea de bază de date respectivă cunoscută sub numele de PostGIS. Deoarece formatul de date diferit servește obiectivelor diferite, depinde de noi să vedem ciocanul AI în cutia de instrumente și să știm când să-l folosim.
Cred că voi continua să primesc PR-uri bazate pe AI, ceea ce nu este rău de la sine și, prin urmare, nu le folosește pentru a adăuga mai multe exemple, a adăuga verificări sau a rescrie părți ale unui cod. Aceeași critică a mea se va aplica dacă, în loc de modificări bazate pe inteligență artificială, aș primi modificări care constau în copierea și lipirea fără prea multă atenție cu privire la relevanța de a face acest lucru.
