SEZONUL 2 · EPISODUL 8

De ce 95% din piloturile AI nu produc profit

Format Express: GPT-6 Astra, dimineața în care ChatGPT, Claude și Grok au căzut deodată, și de ce studiile despre piloturile AI par să se contrazică

Ascultă episodul

Transcript

Transcriere automată a episodului publicat; poate conține mici greșeli, mai ales la nume proprii.

Citește transcriptul complet

Salut! Acesta este AI AFLAT episodul 5, Varianta Express. În câteva minute vorbim despre ce s-a întâmplat recent în AI și ce contează, concret, pentru business. Dacă nu ai aflat deja, afli acum. Trecem prin marile modele, unde patru laboratoare au lansat modele noi în doar trei zile, apoi prin dimineața în care trei dintre cele mai mari chatboturi din lume au căzut în același timp. Aterizăm în România, unde a început construcția primei fabrici naționale de inteligență artificială, iar la final ne oprim mai mult pe prăpastia dintre piloturile de AI și profit și pe cifra despre productivitate care circulă acum peste tot.

Începem cu marile modele. Pe 3 septembrie, OpenAI a lansat GPT-6 cu numele de cod Astra, e construit să opereze software și să stea pe sarcini lungi. Pe OS World, un test de sarcini reale de calculator a obținut 72,6% cu o medie de aproximativ 40 de minute per sarcină. Modelul anterior obținea 65,7% în 75 de minute. Pe un alt test, considerat printre cele mai grele din domeniu, a luat 62,7% într-o configurație neutră și aproape 90% și 9,9% atunci când a păstrat sistemul propriu al OpenAI de gestiunea memoriei și a raționamentului.

Iar o firmă independentă de evaluare a măsurat că, pe testul de agent de programare, ajunge la același rezultat ca modelul precedent, folosind aproximativ o treime din unitățile de text. Două detalii contează mai mult decât scorurile. Primul, OpenAI spune că Astra a atins pragul intern numit critic pe securitate cibernetică, un nivel de capabilitate care a declanșat măsuri suplimentare de protecție, iar în timpul testării modelul a descoperit două vulnerabilități software necunoscute până atunci.

Al doilea, raționamentul lui, scris, a devenit mai greu de urmărit, ceea ce explică parțial de ce lansarea a fost limitată la început. Președintele OpenAI, Greg Brockman, a încheiat prezentarea spunând, textual, bine ați venit în era inteligenței artificiale generale. Concret, asta înseamnă că același model dă 62% sau aproape 100% în funcție de software-ul din jurul lui. Cel care îi ține minte contextul, îi dă uneltele și îl repune pe drum când greșește. Pentru o firmă care alege între doi furnizori, asta schimbă modul de comparat, scorurile din comunicatele de presă descriu motorul, nu mașina.

Comparația care spune ceva se face pe o sarcină reală din firmă, dusă până la capăt, cu trei lucruri măsurate, cât a durat, cât a costat și de câte ori a fost nevoie ca un om să intervină. Ideea asta revine mai târziu un episod cu un nivel mai jos, contează și infrastructura pe care rulează totul și lansările nu s-au oprit acolo. Antropic a scos CloudFable 5.1 cu cost mai mic pe contextul repetat și mai puține întreruperi false ale mecanismelor de siguranță.

Google a lansat Gemini 3.8 Flash, mai bun pe cod și pe sarcini agentice de lungă durată, la același preț ca versiunea anterioară, 75 decenți pentru un milion de unități de text la intrare. Iar Meta a lansat MuseSpark 1.3, trei laboratoare, trei modele de lucru în trei zile. Concret, asta înseamnă că modelele de zi cu zi se ieftinesc și se îmbunătățesc în paralel, iar diferența dintre ele se subțiază. Orice contract semnat pe termen lung cu un singur furnizor, la prețurile de acum șase luni, merită recitit.

Piața a ajuns în punctul în care furnizorul se schimbă mai ușor decât procesul construit în jurul lui. Trecem la firul săptămânii. Tot pe 3 septembrie, joi dimineața, ChatGPT, Cloud și Grok au căzut în același timp. DownDetector a înregistrat peste 37.000 de raportări. Pentru ChatGPT, aproximativ 1.300 pentru Cloud și în jur de 1.360 și 5 pentru Grok. Serviciile au început să revină după aproximativ o oră și au fost complet restabilite după aproape 5.

Cauza a fost o eroare de rutare într-o singură regiune din Microsoft Azure, infrastructura de Cloud pe care rulează 3 dintre cele mai mari 4 chatbot-uri de pe piață, fără atac, fără vreo defecțiune a laboratoarelor de AI, Gemini, care rulează pe Google Cloud, a rămas în picioare cu aproximativ 500 de raportări. Concret, asta înseamnă că 3 furnizori care se prezintă ca alternative unul altuia s-au dovedit a avea același punct de cădere. Într-un episod anterior, l-am citat aici pe Satya Nadella, care spunea că firmele care se bazează pe un singur laborator de AI pentru absolut tot s-ar putea să nu supraviețuiască.

Săptămâna asta arată că problema stă cu un nivel mai jos. O firmă poate avea 3 furnizori de modele diferiți și tot cade odată cu ei dacă toți stau pe aceeași regiune de Cloud. Diversificarea de modele și diversificarea de infrastructură sunt două lucruri separate. Întrebarea care se pune furnizorului nu mai e doar ce model folosește, ci unde rulează și ce se întâmplă când acel unde nu mai funcționează, iar planul de rezervă contează doar dacă a fost testat măcar o dată.

Două actualizări scurte la subiecte din episodul trecut. Achiziția Hugging Face de către Nvidia s-a semnat. 12,93 miliarde de dolari anunțate oficial pe blogul companiei, cu promisiunea că platforma va continua să susțină cloud-uri, modele și hardware concurente, iar listarea Antropic la bursă s-a mutat spre mijlocul lui octombrie, compania aranjând în paralel o linie de credit de 15 miliarde de dolari. Aterizăm în România. Pe 1 septembrie a început implementarea proiectului Aero AI Factory, prima fabrică de inteligență artificială din România.

Infrastructura de calcul de mare performanță va fi găzduită la Institutul Național de Cercetare-Dezvoltare în Informatică din București, cu Universitatea Politehnica București, drept co-coordonator. Finanțarea vine de la Întreprinderea Comună Europeană pentru calcul de înaltă performanță, iar termenul asumat pentru a deveni operațională e finalul lui 2020 și 7, când va funcționa, va putea antrena modele lingvistice de mari dimensiuni, iar România intră în rețeaua europeană de fabrici de AI. Concret, asta înseamnă că, peste puțin mai mult de un an, antrenarea unui model pe date care nu au voie să părăsească țara devine posibilă fără să închiriezi capacitate în altă jurisdicție.

Pentru sectoarele unde asta chiar contează, sănătate, apărare, administrație, servicii financiare, e diferența dintre un proiect blocat de conformitate și unul care poate porni. Până atunci, ferestrele de finanțare sunt deschise acum. Înscrierile pentru programul european de incubare pentru startup-uri AI de la București se închid pe 15 septembrie, iar cele pentru competiția de startup-uri timpurii din cadrul conferinței How to Web pe 11 septembrie. Rămânem un minut pe cifre pentru că aici e întrebarea momentului.

Toată lumea face piloturi, foarte puțin ne arată ce au ieșit din ele, trei studii mari, trei răspunsuri care par să se bată cap în cap. Un raport al inițiativei Nanda de la MIA IT, intitulat Diviziunea AI-ului generativ, a analizat 52 de interviuri cu directori, 153 de răspunsuri de la lideri și 300 de implementări publice. Concluzia, 95% dintre piloturile de AI generativ din companii nu produc niciun return măsurabil la o investiție totală estimată între 30 și 40 de miliarde de dolari.

Doar 5% ajung să extragă valoare reală. Al doilea, sondajul global al PricewaterhouseCoopers, făcut pe 4450 și 4 de directori generali din 95 de țări, arată că 56% dintre ei nu au văzut în ultimele 12 luni nici venituri mai mari, nici costuri mai mici de pe urma inteligenței artificiale. Doar unul din 8 raportează ambele, iar al treilea, raportul Deloitte despre AI în companii, spune că 66% dintre organizații raportează câștiguri de productivitate și eficiență, cel mai frecvent beneficiu din listă, cifrele astea circulă separat și sunt folosite ca să demonstreze lucruri opuse.

Merită spus limpede că ele măsoară 3 lucruri diferite. M.O. White numără piloturile care ajung să miște profitul și pierderea. PricewaterhouseCoopers întreabă directorii generali despre venituri și costuri la nivel de companie pe un an. Deloitte întreabă despre productivitate și eficiență care se simt în munca de zi cu zi fără să apară neapărat în contabilitate. Puse cap la cap nu se contrazic. Descriu aceeași prăpastie din 3 unghiuri. Concret, asta înseamnă că oamenii chiar lucrează mai repede, iar asta se vede în 66% dintre organizații.

Ce nu se vede este drumul de la ora economisită, la leul încasat sau necheltuit. Autorii studiului M.A.I.T. sunt expliciți despre cauze, integrarea slabă, indicatorii de succes aleși prost și fluxurile de lucru rupte, nu calitatea modelelor. Un pilot care nu are stabilit dinainte ce cifră din contabilitate ar trebui să se miște și până când are 95% șanse să rămână o demonstrație reușită. Ora economisită devine bani doar dacă cineva decide explicit ce se face cu ea.

Și ajungem la partea aplicată. Circula acum un clasament al companiilor de inteligență artificială după venitul per angajat și cifrele sunt spectaculoase. 5,1 milioane de dolari per angajat la Magnific.ai. 4,5 milioane la Polsia, care e literalmente un singur om. 4,3 milioane la Cal.ai. 3 milioane la Peter Levels, tot un singur om. Iar Lovable, unde avem cifre din două momente diferite, a trecut de la 100 de milioane de dolari, venit anual recurent cu 40 și 5 de angajați.

În iulie 2025, la 400 de milioane cu 146 de angajați. În februarie anul acesta, adică 2,77 de milioane de dolari per angajat. Iar creșterea asta a venit fără buget de reclame. Compania spune că nu a plătit pentru a aduce clienți, ci că oamenii au ajuns la produs prin recomandare și prin ce vedeau că fac alții cu el. Autoarea analizei a găsit însă ceva mai important decât clasamentul. Mid Journey e citat frecvent cu 200 de milioane de dolari venit la 11 oameni, adică aproape 18 milioane per angajat.

Estimările publice pentru numărul de angajați merg de la 10 la peste 160, iar cele de venit de la 300 la aproximativ 500 de milioane. În funcție de care două numere se combină, iese o poveste complet diferită despre cât de productivă e compania. Din exemplul ăsta, ies trei reguli pentru orice firmă tentată să folosească venitul per angajat ca țintă internă. Prima, venitul și numărul de angajați se iau din aceeași perioadă. Fără regula asta, cifra se poate construi în orice direcție convine.

A doua, companiile din vârful clasamentului au ceva în comun, produse care se vând singure, fără echipe mari de vânzări, fără implementare la client și fără produs fizic defabricat și livrat. Comparația cu o firmă care are vânzări de teren sau distribuție fizică nu spune nimic util. A treia, inteligența artificială poate face a doua companie semnificativ mai productivă, dar nu îi face modelul de business să dispară. Înainte de a promite că dispar oameni, se stabilește ce dispare din costuri.

Concret, asta înseamnă că venitul perangajat e o măsură bună de urmărit în timp în interiorul aceleiași firme și o măsură proastă de comparat între firme cu modele de business diferite. Un consiliu de administrație care își fixează ținta după companiile din vârful listei își fixează ținta după niște firme care vând în esență, altfel decât el. Termenul din episodul acesta, hamul agentului, în engleză harness, este software-ul din jurul modelului care îi administrează uneltele, memoria, reîncercările și decide ce anume supraviețuiește dintr-o sarcină lungă.

Modelul e motorul, hamul e tot restul mașinii, diferența dintre 60 și 2% și aproape 100% la același model vine din ham. Ceea ce înseamnă că 2 furnizori care folosesc exact același model pot livra rezultate foarte diferite, iar o comparație corectă se face pe sarcină reală, dusă până la capăt cu timpul și costul măsurate. Acesta a fost AI AFLAT, formatul expres, episodul numărul 5 din sezonul 2. Mulțumesc pentru ascultare și reacții. AI AFLAT este pe Spotify, Apple Podcasts, YouTube, Facebook, Instagram, LinkedIn, TikTok și Buy Me A Coffee.

Ne reauzim săptămâna viitoare până atunci, nu uita, dacă ai aflat deja, ajută-i și pe alții să afle, să ai o săptămână reușită, numai bine!

Despre AI AFLAT

AI AFLAT este un podcast în limba română despre inteligența artificială, pentru manageri, fondatori și lideri. Un episod nou în fiecare săptămână, creat și găzduit de Răzvan Zlăvog. Urmărește podcastul pe Spotify.