Kako Silicijeva dolina pomaga uriti kitajsko umetno inteligenco

Posel Forbes 16. avgusta, 2026 05.01
featured image

Ista zagonska podjetja iz Silicijeve doline, ki s podatki oskrbujejo OpenAI, Anthropic in ameriško vlado, prodajajo podatkovne nize za usposabljanje umetne inteligence tudi kitajskim laboratorijem, ki razvijajo cenejše modele in konkurirajo njihovim ameriškim strankam.

16. avgusta, 2026 05.01

Ko so prodajne ekipe ameriških zagonskih podjetij iz Silicijeve doline, ki delujejo na področju označevanja podatkov, obiskale letošnjo mednarodno konferenco o strojnem učenju v južnokorejskem Seulu, so prišle pripravljene na pridobivanje največjih kupcev v panogi. Ta podatkovna podjetja – njihova skupna vrednost znaša več deset milijard dolarjev, ustvarjajo pa milijarde letnih prihodkov z dobavo podatkov za usposabljanje modelov strankam, kot sta OpenAI in Anthropic – so navajena, da morajo tekati za laboratoriji za umetno inteligenco, ki so znani po tem, da so zahtevni, muhasti in da jih je težko zadovoljiti.

Pojavila pa se je še ena navdušena stranka, ki si želi njihovih storitev – kitajska industrija umetne inteligence.

Nekatera kitajska podjetja že imajo sezname želja. Tencent – ki ga je ameriška vlada v preteklosti uvrstila med podjetja, povezana s kitajsko vojsko, kar Tencent sicer zanika – je med potencialne dobavitelje razposlal podrobno zahtevo po podatkih za usposabljanje modelov, ki zajemajo finance, kibernetsko varnost in enega najbolj zaželenih raziskovalnih ciljev na področju umetne inteligence – za sisteme umetne inteligence, ki so sposobni samodejnega izboljševanja.

Čipe omejili, podatkov pa ne

Čeprav so ZDA že dolgo nazaj prepovedale kitajske nakupe čipov, na katerih temeljijo vrhunski ameriški modeli umetne inteligence, niso sprejele enakih varnostnih ukrepov, ko gre za podatke, potrebne za njihovo usposabljanje. To “zapakirano” človeško strokovno znanje – ki ga ustvarjajo mreže strokovnjakov, oblikuje pa se z zasnovo nalog, ocenjevalnimi merili in nadzorom kakovosti – je del drage podatkovne infrastrukture, ki modele uči, kako opravljati zahtevne strokovne naloge, kot sta finančno modeliranje in programiranje. Ta panoga je vredna več sto milijonov dolarjev letno in pomaga kitajskim modelom umetne inteligence zmanjševati zaostanek za ameriškimi tekmeci.

“Takoj za računskimi zmogljivostmi, potrebnimi za usposabljanje modelov, so kakovostni podatki najpomembnejši dejavnik,” je za Forbes povedal Nathan Lambert, nekdanji raziskovalec na Allenovem inštitutu za umetno inteligenco. “Ko poskušamo modele uvesti na nova, zahtevnejša področja, je pridobivanje kakovostnih podatkov najpomembnejši dejavnik, ki lahko zagotovi uspešno delovanje modela.”

Dokumentacija in korespondenca kupcev iz kitajskih laboratorijev za umetno inteligenco ter zaposlenih v vodilnih podatkovnih platformah iz Silicijeve doline, kot sta Surge AI in Mercor, ki ju je pregledal Forbes, razkrivata tiho trgovanje z naborom podatkov za usposabljanje v vrednosti več sto milijonov dolarjev. Ista ameriška zagonska podjetja, ki so dobavitelji za OpenAI, Anthropic in v nekaterih primerih tudi za ameriške zvezne organe, oskrbujejo tudi vodilne kitajske laboratorije. Silicijeva dolina tako v tekmi za prevlado na področju umetne inteligence vse bolj podpira obe strani.

Nevronska mreža in strojno učenje
Modeli umetne inteligence so na podlagi podatkov učijo, kako opravljati zahtevne strokovne naloge (Foto: PROFIMEDIA)

Tri poti do podatkov

Za kitajske laboratorije za umetno inteligenco, ki poskušajo dohiteti ameriške, v resnici obstajajo le trije načini za hitro napredovanje. Prvi je, da jim “ukradejo” njihove raziskovalce. Drugi je destilacija, to je pridobivanje izhodnih podatkov iz modelov ChatGPT ali Claude ter njihova uporaba za usposabljanje kitajskih modelov. Čeprav ta praksa ni nezakonita, izrecno krši pogoje uporabe, ki jih določata OpenAI in Anthropic, nedavno pa je nanjo opozoril tudi svetovalec za znanost in tehnologijo v Trumpovi administraciji, Michael Kratsios. Tretja možnost je enostavnejša in ne prinaša potencialnih regulativnih težav. To je nakup istih podatkov za usposabljanje modelov pri istih ponudnikih, pri katerih jih kupujejo ameriški laboratoriji za umetno inteligenco.

Pri učenju modela umetne inteligence za obdelavo zapletenih računovodskih ali spletnih laboratorijskih protokolov ne gre zgolj za zbiranje surovih rezultatov. Prava skrivnost se skriva v specifikacijah podatkov, na primer, na kakšno vrsto podatkov se osredotočiti, pa tudi v zapletenih merilih, ki so jih sestavili strokovnjaki in ki model spodbujajo ter usmerjajo k učenju, kako se spoprijeti z administrativnim delom. Z nakupom teh podatkovnih naborov kitajski laboratoriji učinkovito pridejo do težko pridobljenega lastniškega znanja, na katerem temeljijo najboljši modeli iz Silicijeve doline.

Sean Cai, svetovalec za podatke na področju umetne inteligence, ki vodi istoimenski blog o podatkih in spodbujevalnem učenju (reinforcement learning), to pove brez ovinkov: “Če podrobno preučiš strukturo podatkovne industrije na Kitajskem in nato celotno dobavno verigo s podatki na splošno, boš ugotovil, da se res veliko istih ameriških podatkov, ki poganjajo napredek ameriških modelov, prodaja tudi kitajskim laboratorijem.”

Skrivna dobavna veriga podatkov na Kitajskem

Ta veriga poteka neposredno od ameriških podjetij za označevanje podatkov do največjih kitajskih tehnoloških velikanov, med katerimi so tudi podjetja, kot je Tencent – na katerega je opozoril Pentagon. V enem od sporočil, ki je prišlo v roke Forbesu, je vodilni uslužbenec podjetja Tencent, odgovoren za nabavo podatkov, navedel, da se podjetje pri oskrbi s podatki zanaša na podjetje Surge AI, katerega stranke so tudi ameriška vojska, ameriško letalstvo in Anthropic. Tudi podjetje Mercor, ki je konec prejšnjega meseca svojim zaposlenim sporočilo, da je pridobilo pogodbo z ameriško zvezno vlado, sodeluje s kitajskim Tencentom.

Tudi druga sporočila, ki jih je pregledal Forbes, kažejo na podobno prekrivanje. V izmenjavi SMS sporočil je vodstveni delavec Ant Groupa, kitajskega tehnološko-finančnega podjetja, ki stoji za Alipayem, potrdil tesno sodelovanje z ameriškim podjetjem AfterQuery, ki se ukvarja z usposabljanjem umetne inteligence. Prepis zvočnih posnetkov pogovorov z zaposlenim pri kitajskem velikanu spletne trgovine Alibaba kaže na pogodbe o nakupu podatkov s podjetjema AfterQuery in Mercor. Notranja projektna dokumentacija nakazuje, da je ameriško zagonsko podjetje za označevanje podatkov Turing sodelovalo s podjetjem ByteDance, kitajsko matično družbo TikToka.

ByteDance, Alibaba, Moonshot, Tencent in Ant Group se na prošnjo za komentar niso odzvali, Mercor pa jo je zavrnil. AfterQuery in Surge sta navedla, da podatkov o strankah ne razkrivata. Ameriški pospeševalnik za razvoj umetne inteligence Turing je v izjavi zapisal: “Naše delo podpira najnovejše dosežke na področju umetne inteligence, ki vključujejo tako lastniške kot odprtokodne modele. Menimo, da se bosta obe smeri še naprej razvijali, pri čemer nekateri od najmočnejših odprtokodnih modelov danes izvirajo iz laboratorijev zunaj ZDA.”

Podatkovna znanost in usposabljanje modelov umetne inteligence
Ameriška podjetja, ki se ukvarjajo z označevanjem podatkov, svoje storitve z veseljem prodajajo kitajskim kupcem (Foto: PROFIMEDIA)

Trg, vreden pol milijarde dolarjev

Po navedbah dveh podjetnikov s področja označevanja podatkov, ki sta od vodilnih v podjetjih Tencent in ByteDance prejela ocene velikosti trga, šest največjih kitajskih laboratorijev za umetno inteligenco skupaj letno porabi približno 500 milijonov dolarjev za nakupe pri ameriških podjetjih za označevanje podatkov. Po besedah nekoga, ki je sodeloval z več kitajskimi laboratoriji za umetno inteligenco, ti drug drugega ne obravnavajo kot neposredno konkurenco pri nabavi. Bolj se vidijo kot skupen bazen kupcev, ki išče vrhunske zahodne podatkovne nize.

Ameriška podjetja, ki se ukvarjajo z označevanjem podatkov, jim svoje storitve z veseljem prodajajo. Po besedah vira, ki je seznanjen z zadevo, so prihodki Mercorja iz kitajskih laboratorijev za umetno inteligenco v drugem četrtletju znašali dva odstotka skupnih prihodkov (letni prihodki Mercorja so junija presegli dve milijardi dolarjev), podjetje pa je zaposlilo posebnega vodjo odnosov s kitajskimi strankami.

Po podatkih Forbesa večji del prihodkov iz poslovanja podjetja AfterQuery, (vsaj 50 milijonov dolarjev rednih letnih prihodkov) prihaja iz kitajskih laboratorijev za umetno inteligenco. Tudi Surge AI, eden od pionirjev na tem področju, je aktivno pridobival kitajske kupce. Njegov glavni izvršni direktor Edwin Chen je odpotoval na Kitajsko in se neposredno srečal z vodstvi laboratorijev.

Kupijo iste podatke kot Anthropic

Podjetja za označevanje podatkov kitajskim laboratorijem za umetno inteligenco prodajajo tako projekte po meri, izdelane za enkratno uporabo, kot tudi tako imenovane komercialne nabore podatkov iz zaloge (Off the Shelf ali OTS). Gre za standardizirane, vnaprej pripravljene nize za usposabljanje modelov, ki so namenjeni nadaljnji prodaji več različnim laboratorijem. Sliši se precej neškodljivo, vendar je prodaja teh vnaprej pripravljenih podatkov vse prej kot nedolžna. Izdelani so namreč z uporabo enakih “podatkovnih cevovodov” (knowledge pipelines) kot tisti, ki so bili razviti pri projektih po meri za podjetji OpenAI ali Anthropic.

To pomeni, da imajo kitajska podjetja, ki jih kupijo, dostop do znanja istih mrež strokovnjakov, algoritmov za nadzor kakovosti in meril za preverjanje po zaključku usposabljanja, ki pomagajo sooblikovati usposabljanje modelov v velikih ameriških laboratorijih za umetno inteligenco. In to jim je v izjemno veliko pomoč. V mnogih primerih se lahko kitajski laboratoriji izognejo mesece trajajočim poskusom in napakam preprosto tako, da kupijo nabor podatkov iz zaloge, ki že vsebuje v praksi preizkušene strukture za sklepanje.

“Zavedati se morate, da ta struktura oziroma oblika podatkov včasih izvira iz istih podjetij, ki so svoje metode delovanja natančno prilagodila specifičnim zahtevam Anthropica,” pojasnjuje Cai, svetovalec za podatke na področju umetne inteligence. “Za ponudnika podatkov, ki je sodeloval z Anthropicom, je izjemno enostavno uporabiti isti sistem za pripravo podatkov za kitajski laboratorij.”

Razvijalec umetne inteligence Anthropic
Kitajski razvijalci umetne inteligence iščejo iste podatkovne nize, ki jih za urjenje svojih modelov uporablja Anthropic (Foto: PROFIMEDIA)

Milijardna podjetja

Zato so serijski nizi že pripravljenih podatkov za ponudnike podatkov finančno zelo privlačni. Ker jih je mogoče preprodati več laboratorijem za umetno inteligenco, so najbolj dobičkonosni. “Kitajski laboratoriji za umetno inteligenco pa ameriškim označevalcem podatkov izrecno sporočajo, da želijo kupiti vse podatke, ki so jih že kupili ameriški laboratoriji,” je povedal eden od vodstvenih delavcev, ki je bil v stiku s kitajskimi laboratoriji za umetno inteligenco.

Max Gazor, ustanovitelj podjetja Striker Venture Partners, ki je vlagalo v številne ameriške razvijalce modelov umetne inteligence, priznava, da ta tržna realnost prinaša določene zaplete. “To bi označil bolj kot etično odločitev, ali naj podjetje proda podatke kitajskim laboratorijem s področja umetne inteligence,” je dejal.

Washington je več let gradil geopolitično trdnjavo okoli naprednih čipov. Vendar pa strokovno znanje ljudi, ki se uporablja za usposabljanje umetne inteligence, uspe prečkati meje skoraj brez kakršnegakoli nadzora.

To je pripomoglo k temu, da so se vodilne podatkovne platforme iz Silicijeve doline razvile v milijardne velikane. Mercor, ustanovljen leta 2023, trenutno cilja na vrednost 20 milijard dolarjev, medtem ko je Surge AI, ustanovljen leta 2020, po poročanju vreden vsaj 25 milijard dolarjev. Medtem je relativni novinec AfterQuery v treh mesecih zrasel s 100 milijonov dolarjev na več sto milijonov letnih ponavljajočih se prihodkov. Čeprav velika večina tega še vedno izvira od uveljavljenih ameriških tehnoloških velikanov, je prodaja podatkov v tujino verjetno neustavljivo privlačen sekundarni vir prihodkov.

Kitajski model umetne inteligence kimi K3
Kitajski model umetne inteligence kimi K3 je izkoristil dostop do ameriških podatkov za urjenje umetne inteligence (Foto: PROFIMEDIA)

Vprašanje nacionalne varnosti

Nekateri pravijo, da je prodaja podatkovnih naborov Kitajski vprašanje ameriške nacionalne varnosti. “Nekatera podjetja, ki obdelujejo podatke o ljudeh, sodelujejo s tujimi nasprotniki. Rezultati tega pa so danes vidni v modelu kimi K3 (kitajski odprtokodni model generativne umetne inteligence, ki ga je julija 2026 predstavilo zagonsko podjetje Moonshot AI),” je pred kratkim v objavi na platformi X zapisal 25-letni glavni direktor podjetja Ali Ansari. “Menimo, da je sramota, da nekateri izražajo želje po ameriški prevladi na področju umetne inteligence, obenem pa za milijone prodajajo podatke državam, ki so naše tekmice.” Podjetje Micro1 trdi, da ne prodaja podatkov zunaj ZDA. Tudi Scale AI se je spogledoval s pogodbo s podjetjem ByteDance, a je leta 2024 zaradi pomislekov glede nacionalne varnosti to misel opustil.

Zagovorniki prodaje podatkov pa trdijo, da bi zatiranje te trgovine zadušilo globalne inovacije na področju odprte kode.

“Izvoza podatkov ali umetne inteligence ni mogoče enostavno omejiti na način, ki ne bi bistveno škodoval ameriški odprti kodi,” pravi Cai in poudarja, da sam glede tega vprašanja nima izoblikovanega stališča. “To bi podjetjema OpenAI in Anthropic zagotovilo nepošten duopol, kar pa spet prinaša številne težave,” dodaja.

Avtorica izvirnega članka je Anna Tong.