PixelNode.AI: VC Gözüyle Due Diligence Dosyası
Tarih: 5 Eylül 2026. Hazırlayan: Fable, Berk için. Amaç: yarın yolda okunacak, her iddianın kanıtı ve karşı kanıtı olan tek dosya.
Okuma sırası: bölüm 1 özet, bölüm 13 ve 14 sorular, bölüm 16 sayı kartı, bölüm 18 rakip cevap kartı. Ortadaki bölümler kanıt deposu. Bölüm 23 içeride cevaplanacak sorular.
1. Yönetici özeti
Tez sağlam, pozisyon dar, pencere kısa. Sekiz araştırma hattı ve 300'e yakın kaynağın söylediği şu:
- Talep gerçek ve büyüyor. Anthropic yılda 1 milyar+ ortam harcamasını konuştu ve 12+ satıcıyla çalışıyor; OpenAI "yüzlerce UI gym" aldı, Mercor'un H1 2026 gelirinin %91'i lab'lerden; OpenAI 31 Ağustos'ta on binlerce Mac mini aldı çünkü gerçek uygulama ortamı kıt. Pazar 50+ satıcıda ~8,5 milyar brüt, ~3 milyar net; 25 Haziran - 9 Temmuz 2026 arasında iki haftada Prime Intellect 1 milyar, Bespoke 40M, Deeptune satın alma, Mercor 20 milyar görüşmesi.
- Model artık darboğaz değil, veri ve doğrulama öyle. OSWorld 1.0 doydu (%86). OSWorld 2.0'da en iyi strict tamamlama %42, 163 dakikayı aşan görevlerde sıfır. Yaratıcı ve mühendislik yazılımında: CutVerse %36, DeskCraft %32, KiCad sıfırdan 0/16. Hiçbir lab Premiere, Fusion, Revit'te eğitim yaptığını açıklamadı çünkü lisanslı uygulamalar kamuya açık VM'e snapshot'lanamıyor.
- Boşluk gerçek ama boş değil. Hiçbir hyperscaler, sandbox satıcısı (Cua, E2B, Daytona, Modal, AgentCore) veya bulut PC şirketi (Shadow, Paperspace, Parsec, Vagon'un kendisi) lisanslı yaratıcı yazılımlı GPU masaüstünü lab'e satmıyor. Ama Mercor 70-90 dolar/saatle CAD ekran görüntüsü toplatıyor, Markov CAD kayıtlarını HF'de bedava dağıtıp ayda 100K indirme alıyor, Standard Intelligence 11M saatlik ekran videosunu insansız etiketliyor, Cua substratı saatte kuruşlara emtialaştırdı.
- Destede düzeltilmesi gereken beş iddia: "6 milyar+ pazar" (8,5 milyar brüt / 3 milyar net de); "%20,6" (strict %42 de); "250K uzman hour delivered" (Handshake ve diğerlerinin uzmanları, sizin altyapınız); "no one owns the technology layer" ("expert-desktop katmanı" de); "Mercor/Surge capture yapmıyor" (Mercor CAD ekran görüntüsü topluyor; "faturalama için izliyorlar, biz eğitim için yakalıyoruz" de).
- En büyük hukuki risk lisans, KVKK değil. Adobe Bölüm 17, Maxon 10.4 (Nisan 2026) ve Epic EULA'sı, yazılımı veya çıktılarını AI eğitmek için kullanmayı yasaklıyor. DaVinci Resolve VM'de kuruluma açıkça izin veriyor ve AI maddesi yok; Autodesk ve SolidWorks named-user VDI'ye izin veriyor; Blender, FreeCAD, Godot, KiCad açık. İlk katalog Blackmagic, Blender, Autodesk, Unreal-dışı oyun motoru, KiCad ve açık kaynak üzerine; Adobe ve Maxon için yazılı anlaşma veya hukuki görüş olmadan tek oturum kaydedilmemeli. İkinci risk işçi sınıflandırması: Cox v. Mercor (Ekim 2025) ve Hall toplu davası (Nisan 2026) kişisel makinelerdeki izleme yazılımını hedefliyor; Vagon'un sanallaştırılmış masaüstü modeli bu olgu örüntüsünden çıkışın kendisi.
- Dış görünüm zayıf ve bir VC bunu ilk beş dakikada görecek. Vagon: 2021'den beri tur yok (550K toplam), Trustpilot %20 bir yıldız, 5-10 dakikalık açılış şikayetleri, Virtual sayfasında sıfır sayaçlar ve doğrulanamayan banka referansı. PixelNode: prod'da olmayan ama önizlemede duran ISO/SOC 2 rozetleri, /security 404, "frontier lab'lerle özel beta" iddiasının hiçbir dış izi, "250K" rakamının vagon.io'da bile olmaması. Bunlar düzeltilebilir ve düzeltilmeli; düzeltilmezse tez dinlenmez.
- Kazanma formülü, beş rakip derinlemesinden: gerçek masaüstü yazılımında 60 gün içinde benchmark yayınla ve leaderboard'u host et (SheetBench-50 modeli); lab müşterisini isimlendirerek hill-climb yazısı yaz (AfterQuery'nin Nvidia +11,4 GDPval'i); compute'a göre fiyatla (Mechanize denemesi); Harbor ve OpenEnv üzerine kur; uzmanları tüketici ürünü gibi topla (açık ücret, haftalık Stripe). Tek ürün sat: uzman yakalamalı trajectory + aynı oturumdan türetilen sıfırlanabilir gerçek yazılım ortamı. Checkpoint forking ile "insan kurtarma dalı" verisi, bugün hiçbir açık veri setinde ve hiçbir satıcıda yok; bu, yayınlanacak ilk şey olmalı.
- Çıkış yolu. Lab'ler ekip alıyor (Vercept, Mechanize görüşmesi), pazar yerleri ortam şirketi alıyor (Sepal, Deeptune). Değerleme çarpanları: emek pazar yerleri brütte 5-10x, ortam-yerli işler 10-60x. Net gelir ve %50 üstü marj göstermek, brütte büyük görünmekten değerli.
Pencere: Mercor veya Scale'in lisanslı bulut iş istasyonlarının capex'e değdiğine karar vermesinden önceki 6-12 ay. Bu süre içinde ikinci lab, kamuya açık benchmark ve isimli bir vaka çalışması olmadan pozisyon savunulamaz.
2. Tez ve pazar: neden şimdi
Deste ne diyor: Değerlendirme sınavlardan mesleklere kaydı (GDPval). AI teorik olarak işin %94'ünü yapabilir, pratikte %33'ünü yapıyor. OSWorld 1.0'da ajanlar insanı geçti (73 vs 72), OSWorld 2.0'da en iyi model %20,6. Talep eğrisi, bitiş çizgisi değil.
Doğrulama:
- GDPval [DOĞRULANDI]: arXiv 2510.04374, 5 Ekim 2025. 44 meslek, 9 sektör, 1.320 task, 220 açık "gold" task. Uzmanlar ortalama 14 yıl deneyimli. Teslimatlar xlsx, docx, pdf ağırlıklı. Hugging Face'te ayda ~187K indirme. Model performansı "zamanla kabaca doğrusal" iyileşiyor ve "uzman kalitesine yaklaşıyor". SemiAnalysis: GPT-5.2 uzmanla %71 parite.
- OSWorld 2.0 [DOĞRULANDI]: arXiv 2606.29537, 15 Temmuz 2026. 108 uzun ufuklu görev, insan medyanı ~1,6 saat, Claude Opus 4.7 ile ortalama 318 araç çağrısı (1.0'da ~30). Claude Opus 4.8 max thinking %20,6 binary, %54,8 kısmi. GPT-5.5 %13,0. Opus 4.7 %18,2. Yedi model ailesi: Claude Opus 4.8 ve 4.7, Sonnet 4.6, GPT-5.5, Qwen 3.7-Plus, MiniMax M3, Kimi 2.6. Başarısızlık nedenleri: kısıtları unutma, görev ortasında gelen bilgiyi kaçırma, sormak yerine tahmin etme, doğrulamayı atlama, gizli durumu kurtaramama.
- PC Agent-E [DOĞRULANDI]: arXiv 2505.13909. 312 gerçek insan trajectory'si (PC Tracker ile, kendi Windows makinelerinde), sentetik çeşitlendirme ile birleşince taban modele göre %141 göreli iyileşme.
- "Data wall" [DOĞRULANDI]: Epoch, insan üretimi kamu metninin 2026-2032 arasında tükeneceği projeksiyonu.
Pazar büyüklüğü, doğrulanmış hali:
- Endüstri sayımı Temmuz 2026: 50+ satıcı, ~8,5 milyar dolar brüt gelir. Net (uzman ödemeleri düşülünce) kabaca 3 milyar dolar. [RAPOR, Epoch ve rl-list]
- Wing VC Ocak 2026: Anthropic "yılda on milyonlarca dolar" ortam harcıyor, 2026'ya 3-5x büyüme; OpenAI "birden fazla yedi haneli" sözleşme imzaladı. [GÖRÜŞ+RAPOR]
- The Information: Anthropic liderleri gelecek yıl ortamlara 1 milyar dolardan fazla harcamayı konuştu. [RAPOR]
- Karşılaştırma: OpenAI 2026 Ar-Ge compute projeksiyonu ~19 milyar dolar. Ortam harcaması compute'un yanında küçük. [RAPOR, Epoch]
- Geleneksel etiketleme pazarı ~5 milyar dolar, yılda %50+ büyüme. [GÖRÜŞ, Wing]
VC testi: "6 milyar+ pazar" iddiası eskimiş ve brüt. Doğru cümle: "50+ satıcı arasında 8,5 milyar brüt, ~3 milyar net; ortam harcaması en büyük alıcıda yılda 1 milyar dolara gidiyor."
3. Computer-use ajanlarının durumu (Eylül 2026)
3.1 Lab ürünleri ve veri açıklamaları
| Lab | 2026'da ne çıktı | Eğitim verisi hakkında ne dedi |
|---|---|---|
| Anthropic | Claude Cowork ve Claude Code'da computer use önizlemesi: macOS 23-24 Mart, Windows 3 Nisan [DOĞRULANDI]. Opus 4.8 28 Mayıs. Fable 5 / Mythos 5 9 Haziran (lansman yazısı otonom Factorio oynama ve CAD modelleme örnekleri veriyor). Fable 5.1 / Mythos 5.1 1 Eylül | Hiçbir şey. Tek kamu kanıtı iş ilanları: Environment Scaling (350-850K), "Universes" ultra gerçekçi uzun ufuklu ortamlar (500-850K), Code RL, "Knowledge Work" RL altyapısı (28 Nisan ilanı: "Claude'u gerçek profesyonel iş akışlarında etkili kılan eğitim ortamlarını ve değerlendirmeleri kuran ekip") |
| OpenAI | Operator 31 Ağustos 2025'te kapandı, ChatGPT Agent'a katıldı. GPT-5.6 (Luna/Terra/Sol) 9 Temmuz GA. ChatGPT Work 9 Temmuz: Agent modu emekli, masaüstü uygulamada "Computer Use" tıklıyor, yazıyor, dosya taşıyor, zamanlanmış işler [RAPOR]. GPT-6 Astra 3 Eylül sınırlı önizleme [RAPOR] | Hiçbir şey. SemiAnalysis: şirket içi insan verisi ekibi kuruyor; Mercor, Surge, Handshake'e bağımlılığı azaltmak için |
| Google DeepMind | Project Mariner 4 Mayıs'ta kapandı, Gemini Agent'a katıldı. Gemini 3.5 Flash'ta computer use yerleşik araç, 24 Haziran: tarayıcı, mobil, masaüstü; prompt injection'a karşı "hedefli adversarial eğitim" [DOĞRULANDI]. Gemini Desktop'ta test ediliyor | Hiçbir şey. Genie 3 ile ortam üretiyor. Docs, Sheets, Maps'e sahip olduğu için replikaya daha az ihtiyacı var |
| xAI | Grok Bot beta 11 Ağustos: her ajanın kendi bulut bilgisayarı var; "görevi öğret": iş akışını bir kez yaparken izlemesine izin ver [RAPOR]. Cursor Ultra ve SuperGrok Heavy'ye paketlendi | Ürünün kendisi bir demonstrasyon toplama hunisi. RL Environments Specialist kontratçı ilanı 100-200 dolar/saat [DOĞRULANDI] |
| Meta | Muse Spark 1.1 OSWorld-Verified 80,8; Muse Spark 1.3 OSWorld 2.0 kısmi 66,9 [RAPOR] | En açık lab açıklaması: 21 Nisan notu, çalışanların iş uygulamalarındaki fare, tıklama, tuş vuruşu ve ekran görüntüleri kaydediliyor çünkü "modellerimizin insanların bu uygulamaları gerçekten nasıl kullandığına dair gerçek örneklere ihtiyacı var"; not, modellerin açılır menülerde ve klavye kısayollarında zorlandığını söylüyor [DOĞRULANDI, Fortune] |
| Microsoft | Copilot Studio computer-use ajanları GA, Mayıs 2026. Fara-1.5 açık modeller (4B/9B/27B, Qwen3.5 üzerine), arXiv 2606.20785, 24 Ağustos | En detaylı kamu veri reçetesi: Mayıs 2026'ya kadar 1,57M trajectory adımı: %60 web, %12,8 sentetik ortam, %12,5 form doldurma, %8,8 grounding; %85'i otomatik pipeline; FaraGen task başına ~1 dolar. Gerçek masaüstü uygulaması yok. |
| Apple | WWDC26: SiriKit emekli, App Intents 2.0 ve View Annotations. Yapılandırılmış intent, piksel kontrolü değil | GUI ajanı yok |
| Alibaba Qwen | Qwen3.8-Max 2 Ağustos, 2,4T MoE, 2/6 dolar per M token; ağırlıklar 8 Ağustos. OSWorld-Verified'da 86,1 ile birinci [RAPOR, satıcı beyanı, 5 saatlik eval timeout] | Hiçbir şey |
| ByteDance | 2026'da UI-TARS sürümü yok; son UI-TARS-2 Eylül 2025 (OSWorld 47,5). Rapor: yüzlerce VM'de iz toplayan flywheel, filtre + DPO | Flywheel açıklaması var |
| Zhipu, Moonshot, MiniMax | AutoGLM açık kaynak Aralık 2025; Kimi K2.6 OSWorld-Verified 73,1; MiniMax M3 ve Kimi K2.6 OSWorld 2.0'da %4,6 binary | Hiçbir şey |
| DeepSeek | V4 24 Nisan, V4-Pro 14 Ağustos. Sadece metin, görüş yok: computer-use modeli değil |
3.2 Benchmark'lar
OSWorld-Verified (369 görev, Ubuntu, insan taban çizgisi %72,36), 5 Eylül 2026 anlık görüntü [RAPOR, llm-stats]: Qwen3.8 Max 86,1; Claude Fable 5 85,0; Qwen3.8-27B 84,3; Claude Opus 4.8 83,4; Gemini 3.6 Flash 83,0; GPT-5.6 Sol Max 83,2; Sonnet 5 81,2; Muse Spark 1.1 80,8; GPT-5.5 78,7. Okuma: ilk altı 3 puan içinde, hepsi insanı geçti. OSWorld 1.0 doydu: Nisan 2024'te %12,24, 29 ayda %86.
OSWorld 2.0 (108 iş akışı, medyan 1,6 insan-saati, ~318 araç çağrısı) [DOĞRULANDI]: Uygulamalar FreeCAD, GIMP, Shotcut, REAPER, MuseScore, LibreOffice, VS Code, Zotero + 31 self-hosted web servisi. Görevlerin %27,8'i multimodal düzenleme, %41,7'si görsel-uzamsal hassasiyet gerektiriyor. Görevlerin ~%90'ı "uzman tarzı" dahili anotatörler tarafından uçtan uca yapılarak yazıldı, iki bağımsız anotatör doğruladı.
| Model | Binary | Kısmi | Task başı maliyet |
|---|---|---|---|
| Claude Fable 5.1 (1 Eylül) | 41,7 (strict) | 77,9 | |
| Simular Sai (nöro-sembolik) | 73,0 | ~15,70 dolar | |
| GPT-6 Astra (3 Eylül, çevrimdışı alt küme) | 72,6 | ||
| Claude Opus 5 (max) | 31,4 | 68,3 | |
| GPT-5.6 Sol (max) | 27,3 | 62,7 | |
| Claude Opus 4.8 (batched) | 20,6 | 54,8 | ~72 dolar |
| GPT-5.5 | 13,0 | 49,5 | ~25 dolar |
| MiniMax M3 / Kimi K2.6 / Qwen3.7-Plus | 4,6 / 4,6 / 2,8 | 22 civarı | 2-7 dolar |
Okuma: manşetteki "77,9" kısmi puan. En iyi strict tamamlama ~%42. Makale, 163 insan-dakikasını aşan görevlerde binary başarının sıfıra düştüğünü gösteriyor. Destedeki "%20,6" artık eski; güncel cümle "en iyi model strict %42, uzun görevlerde sıfır".
Diğerleri: AndroidWorld liderliği neredeyse tamamen Çin lab'leri (Qwen3.8 Max 85,3). ScreenSpot-Pro (23 profesyonel uygulama, CAD ve yaratıcı dahil): 2026'da frontier lab sayısı yok; en iyi akademik %61,6, GUI-Eyes-3B CAD alt puanı %48,2. Yoğun profesyonel arayüzlerde grounding %70'in çok altında. WindowsAgentArena-V2: frontier 2026 liderliği yok, Windows Ubuntu'ya göre az benchmark'lanmış. GDPval: GPT-5.2 Pro %74 kazan+berabere (Şubat); Anthropic GDPval-AA v2 Elo Fable 5.1 1853 vs GPT-5.6 Sol 1711.
3.3 Eğitim verisi: bilinenler
| Makale | Tarih | İnsan verisi | Sonuç |
|---|---|---|---|
| PC Agent-E (2505.13909, ICLR 2026) | Mayıs 2025 | 312 insan trajectory'si, PC Tracker ile, Claude 3.7 "Trajectory Boost" ile çoğaltıldı | WAA-V2'de +%141 göreli, Claude 3.7'yi %10 geçti |
| OpenCUA / AgentNet (2508.09123) | Ağustos 2025 | 22.625 trajectory, 140+ uygulama, 190 site, ortalama 18,6 adım, %12,9'u profesyonel alan bilgisi gerektiriyor | Dönemin açık SOTA'sı |
| ANCHOR (2602.07153) | Şubat 2026 | "küçük bir doğrulanmış tohum demonstrasyon seti" dallanma noktalarında genişletildi | OSWorld ve WAA'da tutarlı kazanım; motivasyon "insan demonstrasyonu toplamak pahalı" |
| Fara-1.5 (Microsoft) | 24 Ağustos 2026 | 1,57M adım, %85 otomatik, ~1 dolar/task | 27B Online-Mind2Web 72,3 |
| Mercor + SkyRL | 1 Eylül 2026 | 1.928 uzman yapımı bilgi işi görevi; MCP/kod araçları, masaüstü GUI yok | Qwen3.5-397B Pass@1 16,1'den 27,3'e |
Frontier lab pratiği, dolaylı kanıt: Meta çalışanları kaydediyor [DOĞRULANDI]; Grok Bot ekran kayıtlarını beceriye çeviriyor [RAPOR]; a16z (10 Ağustos): Standard Intelligence "11 milyon saatlik video veri seti" ile 30 FPS computer-action modeli eğitiyor ve ortam satıcıları olarak Mechanize, Habitat, Fleet, Chakra, Deeptune, Matrices, Originator'ı sayıyor [RAPOR]. Hiçbir lab Premiere, Fusion, Revit gibi lisanslı uygulamada eğitim yaptığını açıklamadı. OSWorld 2.0'ın uygulama listesi açık kaynak ağırlıklı çünkü lisanslı profesyonel uygulamalar kamuya açık VM'lere yasal olarak snapshot'lanamıyor.
3.4 Ajanlar nerede başarısız
- OSWorld 2.0: ajanlar bütçelerinin %7'sinden azını kendi hatalarını tespit veya onarmaya, %9,8'ini doğrulamaya harcıyor; en zayıf alanlar örtük durum çıkarımı, çoklu öğe durum takibi, çakışma çözümü, dinamik ortamlar. İnsan için kolay görevlerin sadece %11,1'i ajan için kolay.
- Güvenilirlik (2604.17849, 20 Nisan): tek koşu başarısı tekrar başarısını öngörmüyor; pass^k protokolü ve etkileşimli açıklama isteme öneriliyor.
- Yaratıcı ve mühendislik yazılımı: CutVerse (2605.19484, 19 Mayıs): Premiere ve Photoshop dahil yedi düzenleme uygulamasında 186 görev, en iyi ajan %36. DeskCraft (2606.03103, 2 Haziran): tasarım, video, ses, 3D'de 538 görev, GPT-5.4 %31,6; ajanlar açıklama istemiyor. Snorkel Cua-Bench (15 Haziran): pratisyen bir elektrik mühendisinin yazdığı KiCad şematik görevleri, Claude Sonnet 4.5 4/25, sıfırdan kurma 0/16; hatalar %40 planlama, %22 algı, %19 navigasyon.
- Üreticiler GUI'yi atlıyor: Adobe AI Assistant Premiere, Photoshop, Illustrator, InDesign, Frame.io'da açık beta 18 Haziran (After Effects özel): bin, yeniden adlandırma, marker, kaba kurgu; ChatGPT, Claude, Copilot, Gemini içinden erişilebiliyor [DOĞRULANDI]. Autodesk Fusion MCP teknik önizleme, Blender Lab birinci parti MCP [RAPOR]. Bunlar API/MCP yolları, piksel kontrolü değil; hazırlık işini kapsıyor, yaratıcı çekirdeği değil.
- Ekonomi (a16z, 10 Ağustos): ajanlar 2-3 dakikalık insan görevine 8-10 dakika harcıyor, saatte 6-8 dolar; "biri her çıktıyı inceliyorsa emek tasarrufu olmadı".
3.5 Temmuz-Eylül 2026'da ne değişti
9 Temmuz GPT-5.6 GA ve ChatGPT Work. 13 Temmuz OSWorld 2.0 v2. 2-8 Ağustos Qwen3.8-Max OSWorld-Verified'da birinci olan ilk açık ağırlıklı model. 10 Ağustos a16z "model artık ana darboğaz değil". 11 Ağustos Grok Bot. 24 Ağustos Fara-1.5 v2. 1 Eylül Fable 5.1 ve Mercor'un 397B reçetesi. 3 Eylül GPT-6 Astra. Net: OSWorld 1.0 bilgi vermez oldu; herkes 2.0 kısmi puana geçti; açık bir Çin modeli kısa görevlerde kapalı frontier'ı yakaladı; dört ABD lab'inden üçü computer use'u tüketici yüzeyine koydu; veri açıklaması Microsoft dışında geriye gitti.
3.6 Bir VC'nin computer-use veri arzı hakkında soracağı 10 şey
- Kısa ufuklu masaüstü görevleri doydu ve Fara-1.5 web trajectory'sini ~1 dolar/task'a üretiyor. Doğrulanmış, çok saatlik, profesyonel uygulama trajectory'sinin birim fiyatı ne ve bugün kim ödüyor?
- OSWorld 2.0 FreeCAD, GIMP, Shotcut kullanmak zorunda kaldı. Premiere, Fusion, Revit, DaVinci'yi eğitim ortamına snapshot'lama hakkı kimde, ve üreticiler kendi MCP'lerini çıkarınca bu hendek kalır mı?
- Meta çalışanlarını, xAI müşterilerini kaydediyor. Lab'ler kendi ürünleri üzerinden bedava demonstrasyon toplayabiliyorsa bağımsız veri satıcısının savunulabilir konumu ne?
- Frontier ajanlar tıklamada değil, gizli durum ve doğrulamada başarısız. Kıt varlık demonstrasyon mu, yoksa artefakta bağlı görevler (kesilmiş bir timeline, üretilebilir bir parça) için ödül fonksiyonu ve kontrolcü mü?
- PC Agent-E 312 trajectory'den +%141 aldı; ANCHOR küçük tohumdan büyütüyor. Uygulama başına birkaç yüz uzman demosu yetiyorsa adreslenebilir pazar ne kadar?
- Anthropic yılda 1 milyar+, Mercor 2 milyar ARR ve %90 lab yoğunlaşması. Buna satan herkes için müşteri yoğunlaşması ve sözleşme süresi ne?
- Qwen3.8 veri açıklamadan ve 5 saatlik timeout ile birinci oldu. Alıcılar ne ile eğittiklerini yayınlamıyorsa veri kalitesini nasıl fiyatlarsın?
- CutVerse %36, DeskCraft %32, KiCad %16, sıfırdan 0/16. Yaratıcı ve mühendislik profesyonelleri veri kaynağı mı, müşteri mi, ikisi mi; Surge'ün tıp fellowlarına ödediği 250-450 dolara göre ne ödüyorsun?
- Tek koşu başarısı anlamsızsa veri ürünün pass^k değerlendirme harness'i ile mi geliyor, sadece trajectory mi?
- Adobe, Autodesk ve Blender GUI kontrolü yerine yapılandırılmış araç sundu. Üç yıl sonra profesyonel yazılım ajan trafiğinin ne kadarı API/MCP, ne kadarı piksel olacak; senin veri arzın çizginin hangi tarafında?
Kaynaklar (seçme): OSWorld 2.0, OSWorld-Verified snapshot, Snorkel OSWorld 2.0, Fable 5.1, Gemini 3.5 Flash CU, Grok Bot, Meta memo, Fortune, Fara-1.5, Qwen3.8-Max, PC Agent-E, OpenCUA, ANCHOR, Mercor SkyRL, a16z 10 Ağustos, CutVerse, DeskCraft, Cua-Bench, Adobe Haziran 2026, Autodesk ve Blender MCP, Anthropic Knowledge Work RL ilanı.
4. Lab altyapısı, satın alma davranışı ve Mac Mini dedikodusu
4.1 Mac Mini hikayesi: gerçekte ne rapor edildi
- 31 Ağustos 2026, The Information [RAPOR]: OpenAI son aylarda computer-use ajanlarını RL ile eğitmek için "on binlerce" Mac mini ve Mac Studio satın aldı; ekransız ve klavyesiz, kendi altyapısında. Aynı haber: Anthropic satın almak yerine AWS üzerinden Mac mini kapasitesi kiralıyor. İkincil kaynaklar: The Decoder, TechRepublic, MLQ (31 Ağustos). OpenAI ve Apple yorum yapmadı.
- "10.000" rakamı haberde yok. Bütün kaynaklar "on binlerce" diyor; "10.000" yalnızca toplayıcı sitelerin başlıklarında (shattered.io gibi). Spesifik sayı [DEDİKODU]. Apple'ın 25 Ağustos'taki erken Mac mini/Studio yenilemesinin lab talebinden kaynaklandığı iddiası da doğrulanmamış; Apple bellek kıtlığını gerekçe gösterdi.
- Neden fiziksel Mac [DOĞRULANDI]: Sebep çip değil lisans. Apple'ın macOS lisansı, Apple donanımı başına en fazla iki sanal macOS örneğine izin veriyor ve Virtualization.framework bunu zorluyor (üçüncü konukta hata kodu 6). MacStadium dokümanları iki VM tavanını doğruluyor. Yani macOS ortamları GPU sunuculara yoğun paketlenemiyor; her iki-üç ajan masaüstü için bir fiziksel Mac gerekiyor.
- Kiralama ekonomisi [DOĞRULANDI]: EC2 Mac, Apple lisans gereği 24 saatlik minimum tahsisle saniye başı faturalanıyor; mac-m4pro.metal ~1,97 dolar/saat, ~47 dolar/host-gün, iki VM tam kullanımda ~0,49 dolar/ajan-masaüstü-saati. Scaleway Mac mini M4 Pro AWS'nin yaklaşık dörtte biri fiyatına, aynı 24 saat minimumla. Küçük sağlayıcılarda dedicated Mac host 85-100 dolar/ay. Bu fiyatlarda 600-2.000 dolarlık cihaz haftalar içinde amorti oluyor; OpenAI'ın satın alması ve Anthropic'in kiralaması bununla açıklanıyor.
- Windows veya GPU masaüstü filosu satın alan lab haberi yok. Windows ve Linux host başına tavan olmadan sanallaşıyor, dolayısıyla zorlayıcı bir neden yok. [KANIT YOK]
PixelNode için anlamı: macOS zorlaması size uygulanmıyor ama tezi doğruluyor: lab'ler gerçek uygulama ortamları kıt olduğu için on binlerce Mac, yılda 1 milyar+ bütçe ve 300K'lık replikalara gerçek sermaye harcıyor. Premiere, C4D, Unreal veya SolidWorks yüklü Windows GPU masaüstlerini bugün hiçbir sandbox satıcısı satmıyor.
4.2 Lab'lerin şirket içi ekipleri
- OpenAI: SemiAnalysis (6 Ocak 2026) şirket içi insan verisi ekibi kurduğunu yazdı. İş ilanları: "Agent Post-Training, Frontier Evals and Environments" ve "Synthetic RL" ekipleri. Mercor'un H1 2026 gelirinin ~%90'ı OpenAI ve diğer lab'lerden; içeri alma satıcılar için gerçek marj tehdidi. Ancak veri devleri ajanının bulgusu: OpenAI'ın insan verisini fiilen içeri aldığına dair kanıt yok; Mercor, Surge, Invisible, AfterQuery'nin çapa müşterisi olmaya devam ediyor. 14 Haziran 2026 "Partner Network" bir danışmanlık programı, veri programı değil. İki ajan çelişiyor; doğru okuma: niyet var, tamamlanmış geçiş yok.
- Anthropic: 12'den fazla ortam şirketiyle kontratçı olarak çalışıyor, çoğu alanda belirli sandbox çerçevesine uyum şart, satıcı platformu ortamları bilerek metalaştırıp fiyat düşürmek için. Sandbox runtime'ı açık kaynak yaptı (github.com/anthropic-experimental/sandbox-runtime), Managed Agents için self-hosted sandbox sunuyor. Data Operations Manager ilanları 270-365K.
- Google DeepMind: merkezi olmayan satın alma; coding, computer-use ve ML görev ortamlarına odak; Genie 3 ile ortam üretimi.
- xAI: RL Environments Specialist kontratçı 100-200 dolar/saat, UI ve backend dahil tam ortam kurma.
- Meta MCI [DOĞRULANDI, çoklu kaynak]: Nisan 2026'da ABD çalışanlarının kurumsal MacBook'larına dağıtıldı; Google, LinkedIn, Wikipedia, Gmail, GChat, VS Code dahil tuş vuruşu, fare, tıklama konumu ve ekran içeriği; opt-out yok (CNBC, 22 Nisan). Haziran başı: 1.500-1.600+ imza; Reuters'ın gördüğü notta 30 dakikalık duraklatma düğmesi ve muafiyet talebi tavizi. 22-23 Haziran: güvenlik incelemesi toplanan verinin (AI promptları, transkriptler, özel yazışmalar, performans verisi) binlerce dahili tabloda erişilebilir olduğunu buldu; CTO Bosworth uygulamanın gizlilik incelemesinin "gerisinde kaldığını" söyledi; VP Kasriel kontroller kanıtlanınca devam edeceğini söyledi. Ağustos sonu itibarıyla durdurulmuş, takvim yok. Çıkarım: uzman masaüstü oturumlarını çalışanlardan toplama girişimlerinin en büyüğü, model faydasından değil, rıza ve veri işlemeden çöktü.
4.3 Satın almalar ve ortaklıklar (2025-2026)
- Anthropic, Vercept'i satın aldı (25 Şubat 2026): Vy, uzak bir MacBook'u çalıştıran bulut computer-use ajanıydı; ürün 25 Mart'ta kapandı; ~50M yatırım almıştı; bedel açıklanmadı [DOĞRULANDI]. Hiçbir lab bir ortam satıcısını doğrudan satın almadı. Konsolidasyon bir alt katmanda: Mercor, Sepal (6 Şubat) ve Deeptune (9 Temmuz; Fortune'a göre Foody üç ay önce "esas olarak satın almayı kolaylaştırmak için" melek yatırım yapmıştı).
- Bitişik: Anthropic Bun (Aralık 2025) ve Stainless (18 Mayıs 2026); OpenAI Astral ve Promptfoo (Mart 2026).
- Ürün şirketi ortaklıkları, aynı zamanda ortam işlevi gören: OpenAI + Stripe + Shopify + Etsy (Instant Checkout, 29 Eylül 2025); Benchling + Anthropic (eğitim verisi hakkında açıklama yok); SAP + Anthropic (Mayıs 2026, 200+ ajan); Adobe 22 Haziran 2026: Adobe CX becerileri ve MCP sunucuları Claude Enterprise ve Copilot'ta GA, kapsam sadece Experience Cloud, Photoshop veya Premiere değil. Autodesk ile lab ortaklığı bulunamadı.
4.4 Harcama sinyalleri, güncel tablo
| Sinyal | Rakam | Kaynak | Etiket |
|---|---|---|---|
| Anthropic yıllık ortam bütçesi | 1 milyar+ tartışıldı | The Information via TechCrunch | RAPOR |
| OpenAI UI gym'leri | "yüzlerce site", ~20K/site, tek seferlik ve tekrar kullanılan | SemiAnalysis | RAPOR |
| Task fiyatı | 200-2.000; karmaşık SWE 20K'ya kadar | Epoch | GÜVENİLİR |
| Slack seviyesi replika | ~300K | Epoch | GÜVENİLİR |
| Sözleşme | çeyrek başına 6-7 haneli; 300-500K+ | Epoch | GÜVENİLİR |
| Münhasırlık | 4-5x, iki kurucu bağımsız | Epoch | GÜVENİLİR |
| Mercor H1 2026 | 615M, ~%90 lab | BigGo, The Information | RAPOR |
| Pazar (Temmuz 2026) | 50+ satıcı, ~8,5 milyar gelir, ~100 milyar değerleme, %75+ Scale/Surge/Mercor/Handshake | Pebblous, X pazar haritası | ANALİST TAHMİNİ |
Yön: ortam harcaması büyüyor ama compute'un küçük bir kesri (OpenAI 2026 Ar-Ge compute ~19 milyar). Lab'ler satıcı rekabeti ve içeri alma ile fiyatı aşağı itiyor, münhasırlık ve sadakat için üstüne ödüyor.
4.5 Bulut masaüstü ve sandbox altyapısı
- Ajan sandbox satıcıları [DOĞRULANDI]: Cua (YC X25, MIT): tek API ile Linux, Windows 11/Server 2025, macOS (Apple Virtualization.framework) ve Android; "eğitim, değerlendirme ve veri üretimi için filo" diye pazarlıyor; GPU masaüstü katmanı veya lisanslı yaratıcı yazılım yok. E2B (Firecracker, kod odaklı), Daytona (Haziran 2026'da kapalı kaynağa geçti; Linux masaüstü), Modal (gVisor, H200'e kadar GPU ama masaüstü ürünü yok), AWS AgentCore (Firecracker, tarayıcı ve kod). Hiçbiri ticari yaratıcı uygulamalı GPU masaüstü sunmuyor.
- Hyperscaler bulut PC'ler ajana dönüyor [DOĞRULANDI]: Windows 365 for Agents 22 Ocak 2026 duyuru, şimdi GA; Entra Agent ID, Intune, tüketim faturası; Microsoft Researcher ve Copilot Studio'daki computer-use senaryolarını çalıştırıyor. Amazon WorkSpaces for AI agents: önizleme 5 Mayıs, GA 1 Temmuz 2026, MCP uç noktası, ek ücret yok. İkisi de kurumsal ajan çalıştırma için, eğitim verisi toplama için değil; ikisi de GPU paketi duyurmadı.
- Yaratıcı bulut iş istasyonu satıcıları: Vagon'un sitesinde (bulut bilgisayar, takım çalışma alanı, Unreal/Unity streaming, 23+ veri merkezi) Eylül 2026 itibarıyla AI ajan veya eğitim konumlanması yok. Shadow, Paperspace/DigitalOcean, Parsec/Unity benzer şekilde RL ortamına yönelmedi; Paperspace ML için H100 satıyor ama masaüstü ajan ortamı değil. Hiçbir pivot kanıtı yok. Boşluk bu.
4.6 Yazılım üreticilerinin kayıt ve AI eğitimi tutumu
| Üretici | Sanallaştırma | AI eğitimi maddesi | Etiket |
|---|---|---|---|
| Adobe | Genel koşullarda açık yasak yok | 4.3(C): içeriğinizi üretken AI eğitmek için kullanmayız. Bölüm 17: hizmetleri "doğrudan veya dolaylı olarak herhangi bir makine öğrenimi algoritmasını veya yapay zeka sistemini yaratmak, eğitmek, test etmek veya başka şekilde iyileştirmek için" kullanmak yasak. 6.18: ML için veri kazıma yasak | DOĞRULANDI, 3 Ekim 2025 güncellemesi |
| Maxon (C4D, Redshift, ZBrush) | Named-user, aynı anda tek cihaz, günde beş lisans serbest bırakma | EULA Nisan 2026, §10.4: kullanıcı yazılımı "bir makine öğrenimi algoritması veya yapay zeka sistemi yaratmak, eğitmek, test etmek veya başka şekilde geliştirmek için" kullanamaz ve üçüncü tarafa kullandıramaz | DOĞRULANDI |
| Epic (Unreal) | EULA, Lisanslı Teknolojiyi "herhangi bir Üretken AI Programına eğitim girdisi" olarak kullanmayı yasaklıyor (Ekim 2024 topluluk başlığı; EULA sayfası 403 verdi) | KISMEN DOĞRULANDI | |
| Blackmagic (DaVinci Resolve) | §1.2 açıkça "bir veya daha fazla sanal makine, IaaS veya PaaS dahil" kuruluma izin veriyor, VM başına aynı anda tek son kullanıcı | AI eğitimi maddesi yok; standart tersine mühendislik yasağı | DOĞRULANDI, 2021 EULA PDF |
| Autodesk | Tek kullanıcı abonelik, Flex veya kurumsal anlaşmada VDI serbest, lisans başına aynı anda tek yetkili kullanıcı | AEC Magazine "AI çıktı kısıtlaması" olduğunu yazıyor; sayfa çekilemedi | KISMEN DOĞRULANDI |
| Dassault (SolidWorks) | VDI yaygın pratik | AI dili doğrulanamadı | DOĞRULANMADI |
Desen: hiçbir üretici bir insanın kendi iş akışını ekran kaydına almasını yasaklamıyor ve hiçbiri named-user ticari lisansta sanallaştırmayı tümden yasaklamıyor. Adobe, Maxon ve Epic yazılımı AI eğitmek veya iyileştirmek için kullanmayı yasaklıyor. Bir insanın yazılımı çalıştırmasını kaydedip video ve girdi akışı üzerinde eğitim yapmanın "yazılımı AI eğitmek için kullanmak" sayılıp sayılmayacağı hukuken test edilmemiş. Bir lab karşı tarafı bunu türev eğitim verisini kapsar diye okuyabilir.
Azaltıcılar: (a) uzmanın kendi ticari lisansıyla named-user kuralları altında, VM başına tek kullanıcı ile kayıt; (b) ürünü "otomatik yazılım operasyonu" değil "insan iş akışı verisi" olarak yapılandırmak; (c) Benchling/SAP/Shopify emsallerinde olduğu gibi yazılım şirketini hedef değil ortak yapan açık anlaşmalar; (d) ilk katalogda izin veren üreticilere öncelik: Blackmagic en güvenli, Autodesk ve SolidWorks named-user VDI'ye izin veriyor, Blender ve FreeCAD ve Godot açık.
4.7 Çıkış yolları
Lab'ler ajan ekipleri (Vercept) ve geliştirici araçları satın alıyor; ortam startup'ları Mercor tarafından toplanıyor (Sepal, Deeptune). Alıcı olarak Mercor, Surge, Scale veya Handshake'i, müşteri olarak lab'leri planlayın; lab'ler işe yaradığı kanıtlanan her şeyi içeri almaya çalışacak.
Kaynaklar: The Decoder, 31 Ağustos, TechRepublic, MacStadium VM sınırı, EC2 Mac, beri.net analiz, SemiAnalysis, Anthropic sandbox-runtime, xAI ilanı, CNBC MCI, Malwarebytes MCI durdurma, TechTarget MCI durum, Anthropic/Vercept, Mercor/Deeptune Fortune, Adobe CX ve MCP, Windows 365 for Agents, WorkSpaces for AI agents, Cua, Adobe koşulları, Maxon EULA, Epic forum, Blackmagic EULA, Autodesk sanallaştırma.
5. Rakip derinlemesine A: AfterQuery, Fleet, Mechanize, Bespoke Labs, HUD
Not: Faz 1 landscape'te üç "bilinen" iddia bu derinlemesinde düzeltildi. AfterQuery Terminal-Bench'in sahibi değil (Laude Institute ve Bespoke ekibi). HUD OSWorld-Verified'ın sürdürücüsü değil (XLANG Lab; HUD geri bildirim kanallarından biri ve bir leaderboard host'u). Harbor Fleet'in çerçevesi değil (Laude Institute). HUD bulut fiyatı 0,25 değil 0,10 dolar/ortam-saat. Lab'ler bu tür şişirmeleri fark ediyor; PixelNode'un destesi de aynı sınavdan geçecek.
5.1 AfterQuery
- Kuruluş: 2025, lise arkadaşları Spencer Mateega (CEO, 23) ve Carlos Georgescu (CTO, 22), YC W25, SF, ~30 kişi, 11 açık rol (LatAm işe alım altyapısı mühendisi dahil) [DOĞRULANDI, YC]. 500K pre-seed [RAPOR, Sacra].
- Yatırım: Series A 30M @ 300M post, Altos lider, Raine, YC, BoxGroup, Latitude; DeepMind, OpenAI, Anthropic, Meta MSL, Microsoft AI'dan melekler; 9 Nisan 2026 [DOĞRULANDI, BusinessWire]. 1 Eylül 2026: Forbes, 3,2 milyar değerlemeli tur; büyüklük ve lider açıklanmadı; YC'nin Gustaf Alströmer'i "lansmandan unicorn'a en hızlı, 18 ay" dedi [RAPOR, TechCrunch, Dealroom].
- Gelir: 100M+ run-rate, 9 Nisan 2026 [DOĞRULANDI]. Yeni rakam yok; Sacra "multi-million ACV" ve "ABD'deki her frontier lab" müşteri.
- Ürün: on iki SKU: rubric/verifier RL, gerçek API ve MCP sunucularında tool-calling ortamları, SFT, RLHF, kod üretimi, "yüksek sadakatli tarayıcı ve masaüstü ortamlarını uzman demonstrasyonlu trajectory'lerle eşleyen computer-use ve browser-use ortamları", derin araştırma, loss analizi, multimodal, hazır veri. İnsan verisi çekirdek. Masaüstü var ama hangi yazılım açıklanmıyor. Uzman ağı: Sacra ~100K, ürün sayfası şimdi 300K+ [tutarsızlık]. Ücret: üçüncü taraf takipçilerde 35-250, uzmanlar 100-250.
- Müşteriler: Nvidia (Nemotron 3 Ultra, AfterQuery'nin Office Agent Training Dataset'i ile "11,4 GDPval puanı" kazandı, 2 Temmuz 2026), Legora (hukuk eval, 28 uygulama alanında 5.161 dava, 30 Ağustos), Motif Technologies (Motif 3'ün tek veri ortağı, 23 Ağustos), DeployCo/ServiceCo vaka çalışması (3 Haziran). İlk lab: belgelenmemiş; YC demo günü + FinanceQA (30 Ocak 2025, batch sırasında yayınlandı) kama gibi görünüyor.
- Lansman ve GTM: benchmark güdümlü: FinanceQA (Ocak 2025), UI-Bench (Ağustos 2025), App-Bench (Ekim 2025), Market-Bench (Aralık 2025), IDE-Bench (Ocak 2026, arXiv 2601.20886), VADER; sonra "Tinker ve Harbor ile Terminal-Bench 2.0'ı 5x nasıl iyileştirdik" (31 Mart 2026) ve GDPval on-policy distillation yazısı (8 Haziran). GitHub'da Harbor, SkyRL, verl fork'ları; başkalarının benchmark'larında hill-climb sonuçları yayınlıyor. Uzman toplama tüketici ölçekli huni: YouTube işe alım videoları ("AfterQuery'de saatte 40-250 dolar kazan"), her Cuma Stripe ödemesi, kademeli parkurlar. Yatırımcı kanal olarak: Raine hem yatırımcı hem ortak ("Last Mile" yazısı, 28 Nisan). Kamuya açık fiyat yok.
- Farkı: Mercor tarzı uzman pazar yerini benchmark yayıncılığı ve isimli müşteri hill-climb yazılarıyla sarıyor; her teslimat bir lab araştırmacısının gerçekten okuyacağı pazarlamaya dönüşüyor.
- VC'nin işaretleyeceği zayıflıklar: ~100M run-rate üzerine 3,2 milyar (32x ve run-rate beş ay eski); tur büyüklüğü ve lideri açıklanmadı; 20'li yaşlarındaki iki kurucu 300K kontratçı ölçekliyor; Scale/Mercor/Surge ile örtüşme; computer-use on iki SKU'dan biri, masaüstü çekirdek yetkinlik değil; benchmark enflasyonu riski (lab'ler AfterQuery verisiyle eğitip AfterQuery benchmark'ında puanlanıyor).
5.2 Fleet AI
- Kuruluş: 2024, Nicolai "Nic" Ouporov, Respell'in kurucu mühendisi (Salesforce satın aldı, Ocak 2024), Stanford/Columbia araştırma geçmişi; New York [RAPOR, Sacra, Crunchbase]. SemiAnalysis (Ocak 2026): 20 kişiden az, 1-3 müşteri. 11 Şubat 2026 "Notes" yazısı: önce müşteri olarak gelip sonra kurucu MTS olan Fred Havemeyer.
- Yatırım: Seed 15M (Sequoia, Menlo, SV Angel), tarih yok. 14 Nisan 2026: 50M+ @ ~750M görüşmesi, Bain lider [RAPOR, The Information]. 1 Haziran 2026: RuntimeWire, duyurulmamış insider liderliğinde 45M Series A @ 725M [RAPOR]. Fleet hiçbir turu kendisi duyurmadı; A turu rapor edilmiş, doğrulanmamış.
- Gelir: 2025 sonu ~1M'den Nisan 2026'da ~60M'ye (Sacra), Haziran'da ~63M ve gelecek çeyrek 160M projeksiyonu (RuntimeWire). Q3 gerçekleşeni yayınlanmadı.
- Ürün: "ajanlar için eğitim salonu": Salesforce, Excel, tarayıcı, IDE, tıbbi kayıt, CAD, LMS'in yüksek sadakatli replikaları; Python SDK, versiyonlu deterministik ortamlar, reset ve durum inceleme; "gym-anything" (ekran görüntüsü/fare/klavye arayüzü). İnsan verisi: "simüle ortamları insan denetimiyle eşliyor". İki gelir katmanı: ısmarlama kurumsal ortam (baskın) ve 60 gün deneme ile platform. GitHub: harbor-train (Harbor üzerinde GRPO, SkyRL ile), SkyRL/OpenEnv/miles fork'ları, arşivlenmiş fleet-sdk (17 yıldız), RL araştırmacılarını gece gece arXiv'den kazıyan bir repo.
- Müşteriler: Fleet hiç isim vermedi. Sacra: frontier lab'ler + finans ve sigorta kurumsalları.
- Lansman ve GTM: neredeyse hiç kamuya açık lansman yok. Site tek satırlık misyon; fiyat sayfası 404; tek blog yazısı; SDK arşivli [DOĞRULANDI, 5 Eylül 2026'da çekildi]. GTM "yüksek temaslı, kurucu veya mühendis liderliğinde, forward-deployed". Görünen tek büyüme kaldıracı: Sequoia/Menlo seed'li gizli şirket bir yılda 60M'ye ulaştı, sonra The Information'a sayıları sızdırdı. İşe alım "deployment, generalist mühendislik, ortam mühendisliği" ağırlıklı. Araştırmacı kazıyıcı repo, outbound'un araştırmacı hedefli olduğunu gösteriyor.
- Farkı: beşi içinde en az kamu artefaktı üretip en çok satıyor; lab ve Fortune 500 için saf forward-deployed replika inşası, içerik yerine gelir sızıntısı PR'ı.
- Zayıflıklar: sıfır isimli müşteri; gelir ve tur rakamları ikinci el; replika sadakati gerçek yazılım üreticilerine (ServiceNow WorkArena, Salesforce'un kendisi) karşı sürekli koşu bandı; arşivli SDK "platform" anlatısıyla çelişiyor; 160M projeksiyonu yüksek çıta; aşırı lab yoğunlaşması.
- Temmuz-Eylül 2026: birinci elden haber yok.
5.3 Mechanize
- Kuruluş: 17-23 Nisan 2025, Ege Erdil'in X gönderisiyle; kurucular Tamay Besiroglu, Ege Erdil, Matthew Barnett, hepsi eski Epoch AI. Lansman destekçileri: Nat Friedman, Daniel Gross, Patrick Collison, Dwarkesh Patel, Jeff Dean, Sholto Douglas. Lansman ağır eleştiri aldı ("tüm işin tam otomasyonu"; PauseAI Besiroglu'na "hain" dedi). ~35-38 kişi.
- Yatırım: 9,1M @ 500M post, 24 Nisan 2026, Marco Mascorro, Adam D'Angelo, Devendra Chaplot [DOĞRULANDI]. Google anlaşması: Business Insider (5 Ağustos 2026), 1,5 milyar+ için ileri görüşmeler, münhasır olmayan lisans + bazı personelin işe alınması (Windsurf deseni); iki taraf da yorum yapmadı [DEDİKODU/RAPOR]. 5 Eylül itibarıyla doğrulanmadı.
- Gelir: hiç açıklanmadı.
- Ürün: frontier coding ajanları için RL ortamları ve eval'ler; derin, zor SWE görevleri, otomatik puanlama; açık kaynak değil. Konteynerde gerçek kod, UI replikası değil. Computer-use yok. Kalabalık yok; elit dahili mühendisler task yazıyor. Kamu artefaktı: GBA Eval (2 Mayıs 2026): 24 saatte Rust'ta WASM'a Game Boy Advance emülatörü yaz, deterministik girdi tekrarında Mesen2'ye karşı kare kare puanlanır; "en iyi AI lab'leriyle Mechanize'da yaptığımız işi yansıtıyor".
- Müşteri: Anthropic (TechCrunch, iki kaynak, 16 Eylül 2025; iki taraf da yorum yapmadı) [RAPOR]. İlk lab kuruluştan ~5 ay sonra itibarla geldi (Epoch tahmin kredibilitesi, Dwarkesh/Sholto ağı).
- Lansman ve GTM: deneme güdümlü: "How to fully automate software engineering" (30 Mayıs 2025), "The upcoming GPT-3 moment for RL" (20 Haziran), "Sweatshop data is over" (10 Temmuz), "Cheap RL tasks will waste compute" (18 Ağustos 2025; HN ön sayfasına iki kez çıktı). Pazarlama olarak işe alım: TechCrunch'ın 500K maaş kancası; şu anki başvuru sayfası 300-400K + hisse, SF'te yüz yüze, "iki dakikada başvur". Açık kaynak yok, fiyat yok, GBA Eval dışında benchmark sahipliği yok.
- Farkı: kıtlık satıyor: 400K'lık mühendislerin kurduğu birkaç düzine çok pahalı ortam, tasarruf ettirdiği compute'a göre fiyatlanmış, hacim veya platform yerine aykırı denemelerle pazarlanmış.
- Zayıflıklar: tek rapor edilmiş müşteri; gelir açıklaması yok; 9,1M üzerine 500M post bir acqui-license opsiyonu ve Google görüşmeleri yatırımcıya şirket değil lisans ücreti payı bırakır; "tüm işi otomatikleştir" lansmanının marka yükü; computer-use yok; kurucular Google'a giderse kilit kişi riski.
5.4 Bespoke Labs
- Kuruluş: 2024, Mountain View; Mahesh Sathiamoorthy (CEO, eski Google DeepMind staff research engineer) ve Alex Dimakis (CSO, UC Berkeley profesörü). Haziran 2026'da 13 kişi ekledi, Grammarly'den Head of Data Ops dahil.
- Yatırım: toplam 40M, 6 Temmuz 2026: Series A Wing (Peter Wagner) lider, Mayfield, The House Fund, Tristan Handy, Anthropic/OpenAI/Meta melekleri; seed 8,25M 8VC lider, Jeff Dean, Spiros Xanthos, Dheeraj Pandey [DOĞRULANDI]. Değerleme açıklanmadı.
- Gelir: açıklanmadı. "Fortune 500 ve frontier lab'ler", "GEPA'yı üretimde kullanan 200+ araştırma ekibi".
- Ürün: uzun ufuklu ajanlar için RL ortamları ve altyapı; "Slack, e-posta, Jira, mikroservisler, loglar dahil simüle dünyalar" (3 Eylül 2026 blogu). Yani konteynerize simüle araç ekosistemleri, masaüstü replikası değil, gerçek SaaS değil. Computer-use yok. Ortam kurmak için "uzman ağı" var. Açık kaynak: Curator (veri küratörlüğü), OpenThoughts (500K+ indirme), Terminal-Bench'in çekirdek katkıcısı (Anthropic, OpenAI, DeepMind atıf yapıyor), GEPA optimizer (ICLR 2026).
- Müşteriler: isim yok. Terminal-Bench'in üç büyük lab'ce benimsenmesi kredibilite yolu; ilk lab muhtemelen satış değil benchmark üzerinden geldi.
- Lansman ve GTM: önce açık araştırma: Bespoke-MiniChart-7B (Nisan 2025), 150 katılımcılı Reasoning Datasets yarışması (Mayıs 2025), Terminal-Bench makalesi (arXiv 2601.11868), GEPA ICLR 2026, ConjectureBench 15K açık matematik problemi (31 Temmuz 2026), Inkling post-training yazısı (3 Eylül 2026). "RL ortamı kurmak için alan uzmanı" işe alıyor. Fiyat yok. Konumlanma cümlesi: "ajanın öğrendiği ortam, demokratikleşmeyecek tek önemli bileşen".
- Farkı: akademik lab ekonomisi: lab'lerin standartlaştığı benchmark ve optimizer'ı bedava ver, sonra o benchmark'ların gerekli kıldığı ortamları sat.
- Zayıflıklar: fonlu dördü içinde en küçük açıklanan sermaye, değerleme ve gelir yok; iki yaşında ve isimli müşteri yok; yol haritası veri seti, optimizer, benchmark ve ortam arasında dağılmış; Terminal-Bench yönetişimi Laude Institute'ta, hendek paylaşımlı; masaüstü yok.
5.5 HUD
- Kuruluş: YC W25; Jay Ram (CEO), Lorenss Martinsons (CPO, Yale bilişsel bilim), Parth Patel (CTO); 15 kişi; SF ve Singapur; ilk ürün yazısı "HUD Autonomy" 24 Ocak 2025. Tüzel ad Human Union Data, Inc. 13 açık rol, maaş bantları yayınlanmış (Research Engineer 140-250K, GTM Engineer 120-170K, Marketing & Events Lead 40-70K).
- Yatırım: 16M Series A, Standard Capital lider, 30 Haziran 2026, YC, Exceptional, Liquid 2, Twenty Two; melekler Dylan Patel, Roon, Ivan Burazin, Theo Browne. Liderin çerçevesi: "HUD, ScaleAI'a göre Airbnb'nin Hilton'a göre olduğu şey" [DOĞRULANDI].
- Gelir: açıklanmadı; "satıcı pazar yeri ayda milyonlar üretiyor" (GMV, gelir değil).
- Ürün: MIT lisanslı hud-python SDK (299 yıldız), herhangi bir yazılımı Docker konteynerinde MCP tarzı ortam olarak sarar, task ve reward ile; bulut runner; üçüncü tarafların ortam kurup lab'lere sattığı DataVendor pazar yeri; otomatik QA (reward hacking ve false positive tespiti). Konteynerde gerçek yazılım evet (tarayıcı, Google Sheets, oyunlar, kod tabanları); replika yok; computer tool var. İnsan verisi çekirdek değil ama SheetBench-50 PwC/Cisco/Schwab/Fannie Mae analistleriyle üçlü kör çözümle, Sepal ile birlikte (1 Ekim 2025). Metrikler: 1,3M task koşusu, 2.500 ortam, 15M inference çağrısı, 50+ işletme. Fiyat: Cloud 0,10 dolar/ortam-saat, 10 dolar ücretsiz kredi, .edu için 100 dolar.
- Müşteriler: UiPath (UI-CUBE benchmark), Sharpe, DoorDash. İlk lab teması: Autonomy-10, OpenAI Operator'ı lansmanda değerlendirdi (Ocak 2025).
- Lansman ve GTM: product-led + SEO: ücretsiz SDK, pip install hud, kredi kartı yok; yoğun rehber kütüphanesi (Mart-Temmuz 2026'da 16+ yazı: "Best Gymnasium Alternatives", "How to Sell Startup Assets to Model Labs", "GRPO in 100 lines") uzun kuyruk kurucuları ve ölü startup kod tabanlarını ortam arzı olarak hedefliyor. Benchmark'lar: Autonomy-10, SheetBench-50 (Hugging Face), OSWorld-Verified leaderboard host'u. Etkinlik: Agent Native Builders Hackathon sponsoru, 26-27 Ağustos 2026, Cloudflare SF.
- Farkı: hizmet dükkanı değil iki taraflı pazar yeri ve araç zinciri; diğer her satıcının (ve PixelNode'un) üzerinde yayın yaptığı ray olmak istiyor.
- Zayıflıklar: 16M Fleet ve AfterQuery'ye göre küçük; pazar yeri GMV'si marj değil; DataVendor ve leaderboard'lar giriş arkasında; lab'ler doğrudan alabilirken pazar yeri üzerinden almalarına bağımlı; 299 yıldız mütevazı geliştirici çekimi; gelir yok.
5.6 Karşılaştırma
| AfterQuery | Fleet | Mechanize | Bespoke | HUD | |
|---|---|---|---|---|---|
| Kuruluş | Ocak 2025 (YC W25) | 2024 | Nisan 2025 | 2024 | Ocak 2025 (YC W25) |
| Son tur | 3,2 milyar değerleme, 1 Eylül [RAPOR]; 30M A @ 300M Nisan [DOĞRULANDI] | ~45-50M @ 725-750M, Q2 2026 [RAPOR] | 9,1M @ 500M, Nisan 2026 [DOĞRULANDI] | 40M toplam (A Wing lider), Temmuz 2026 [DOĞRULANDI] | 16M A (Standard), Haziran 2026 [DOĞRULANDI] |
| Gelir | 100M+ RR Nisan 2026 | ~60-63M RR Nisan-Haziran | yok | yok | yok |
| Çekirdek | uzman verisi + ortam | yazılım replikaları | zor SWE konteynerleri | simüle araç dünyaları | konteyner SDK + pazar yeri |
| Gerçek yazılım | kısmen (API, MCP) | hayır, replika | gerçek kod | simüle | evet, sarılmış |
| Masaüstü/CU | evet (bir SKU) | evet (çekirdek) | hayır | hayır | evet (araç) |
| İnsan verisi | çekirdek, 100-300K uzman | denetim katmanı | dahili elitler | uzman ağı | hafif |
| İsimli lab müşterisi | Nvidia, Motif | yok | Anthropic [RAPOR] | yok | OpenAI (Operator eval) |
| Açık kaynak | fork'lar, benchmark'lar | harbor-train, fork'lar | yok | Curator, OpenThoughts, GEPA, T-Bench | hud-python (MIT) |
| Fiyat sinyali | yok | 60 gün deneme | task başı ~500-birkaç bin dolar (deneme) | yok | 0,10 dolar/ortam-saat |
| Kişi | ~30 | <20 | ~35-38 | ~30+ | 15 |
5.7 PixelNode'un kopyalaması ve kaçınması gerekenler
Kopyala:
- 60 gün içinde gerçek masaüstü yazılımında benchmark yayınla ve leaderboard'u host et. HUD'un SheetBench-50'si (50 görev, isimli firmaların analistlerince üçlü çözülmüş, Hugging Face'te) bu setteki en ucuz kredibilite oyunu. PixelNode'un avantajı gerçek bulut masaüstünde gerçek yazılım; uzmanların yakaladığı Excel, CAD, DaVinci, Blender görevlerinden "DesktopBench" ve kamuya açık leaderboard, mevcut lab müşterisini atıfa dönüştürür.
- Lab müşterisini isimlendirerek hill-climb vaka çalışması yaz. AfterQuery'nin "Nvidia için +11,4 GDPval puanı" ve "Tinker ve Harbor ile 5x Terminal-Bench 2.0" yazıları desen: kendi yaratmadığın kamu benchmark'ını seç, verinle eğit, farkı yayınla. Mevcut lab'in onayıyla tek böyle yazı, bir yatırım duyurusundan değerli.
- Saate değil compute'a göre fiyatla. Mechanize'ın denemesi çapayı task başına yüzlerce-binlerce dolara sabitledi ve sektör çerçevesi yaptı. PixelNode masaüstü trajectory'leri için kendi versiyonunu yayınlamalı: doğrulanmış uzman saati maliyeti vs düşük sadakatli replikada boşa giden RL rollout maliyeti.
- Harbor ve OpenEnv üzerine kur, harness icat etme. AfterQuery, Fleet ve Bespoke'un üçü de Harbor/SkyRL fork'luyor; lab'ler zaten çalıştırıyor. Bir harbor-pixelnode adaptörü ve HUD DataVendor listesi, ortamları satış döngüsü olmadan lab pipeline'ına sokar.
- Uzmanları tüketici ürünü gibi topla. AfterQuery'nin açık ücret kademeleri, haftalık Stripe ödemesi ve YouTube işe alım hunisi arzı ölçeklemesinin sebebi. Ücretleri ve ödeme takvimini yayınla, Vagon kullanıcı tabanını ilk kohort yap.
- İşe alımı PR yap. Mechanize'ın 500K maaş satırı seed'inden fazla haber üretti. Bantları yayınla (HUD yapıyor), bir rolü bilerek dikkat çekici yap.
- Turu basın bültenine değil sızdırılan metriğe zamanla. Fleet iki The Information sızıntısıyla bilinmezden 725M'ye gitti. Lab sözleşmesi yenilenirken hazır bir run-rate rakamın olsun.
Kaçın:
- Fleet gibi karanlığa çekilme: tek satırlık site, 404 fiyat sayfası, arşivli SDK sadece Sequoia'nın telefon listesiyle çalışır.
- İdeolojik manifesto ile lansman yapma: Mechanize'ın "tüm işi otomatikleştir" çerçevesi, ortam satın alan güvenlik yanlısı araştırmacılarda iyi niyet kaybettirdi.
- Sahip olmadığın benchmark sahipliğini iddia etme.
- On iki SKU'ya yayılma: tek şey sat: uzman yakalamalı trajectory + sıfırlanabilir gerçek yazılım masaüstü ortamı.
- Lab'lere ulaşmak için pazar yerine güvenme: HUD'un DataVendor'ı kanal, strateji değil.
- Bir sonraki sayı olmadan run-rate açıklama: AfterQuery'nin 100M'si beş ay eski ve 3,2 milyarına karşı kullanılıyor.
Sonuç: pazar beş türe ayrıldı: uzman veri pazar yeri (AfterQuery), replika salonu (Fleet), elit task atölyesi (Mechanize), açık araştırma altyapısı (Bespoke), araç ve pazar yeri (HUD). Beşinden hiçbiri çalışan profesyonellerden yakalanmış gerçek masaüstü yazılımı satmıyor. Bu boşluk, HUD'un 0,10 dolar/ortam-saat tabanı ve Mechanize'ın task başına binlerce dolar tavanı, PixelNode'un fiyat koridorunu ve konumunu tanımlıyor.
Kaynaklar: YC AfterQuery, AfterQuery Series A, TechCrunch AfterQuery unicorn, AfterQuery ürünler, AfterQuery blog, Sacra Fleet, Fleet Series A raporu, Fleet GitHub, Harbor, Mechanize 9,1M, Mechanize GBA Eval, Google-Mechanize raporu, Bespoke 40M, Bespoke blog, HUD Series A, HUD SheetBench-50, XLANG OSWorld-Verified, HUD GitHub.
Ön veri, doğrudan çekilen:
- Fleet [DOĞRULANDI, Sacra]: CEO Nicolai Ouporov. Seed 15M (Sequoia, Menlo, SV Angel). Nisan 2026'da Series A görüşmesi 50M+, ~750M değerleme, Bain lider. Run-rate Nisan 2026 60M (2025'te 1M). Erken gelir "finans ve sigorta şirketlerine ısmarlama ortam"; sonra platform, 60 gün deneme, kullanım bazlı fatura. Ürün: kurumsal yazılım replikaları (Salesforce, Excel), Python SDK, Harbor açık kaynak değerlendirme çerçevesi, %99,993 uptime. Riskler: lab yoğunlaşması, "benchmark overfitting", lab'ler içeride kapasite kurunca run-rate'in normalleşmesi. Strateji: yazılım üreticilerine "sertifikasyon katmanı" satmak, EU AI Act uyum altyapısı olmak.
- HUD [DOĞRULANDI]: YC W25, 15 kişi, SF. Gerçek yazılımı konteynerde sarar, açık SDK, bulut gateway. OSWorld-Verified'ı sürdürüyor (369 görev, 300+ hata düzeltildi, 50 paralel ortam). SheetBench-50. 50+ müşteri. Fiyat: SDK ücretsiz, bulut 0,25 dolar/ortam-saat'ten başlıyor, 10 dolar ücretsiz kredi, kurumsal özel. Kendi yazdığı "ortam yayınlama platformları" rehberinde (6 Nisan 2026) kendini 1 numara koyuyor; Harbor, Prime Intellect, Gymnasium, RLlib'i kıyaslıyor.
- Mechanize [DOĞRULANDI]: Nisan 2025, eski Epoch araştırmacıları. ~9,1M yatırım, ~500M değerleme. Anthropic ile çalışıyor. Mühendislere 500K maaş. "Cheap RL tasks will waste compute" (18 Ağustos 2025): task başına compute 480 dolar, 5 tekrar kullanımla ömür boyu ~2.400 dolar; task fiyatı en az ~500 dolar olmalı, bir yıl içinde binlerce dolar; transcript uzunluğu yılda 5x artıyor (20K token'dan 100K'ya, bir yılda 500K'ya). Sonuç: ucuz kontratçı yerine tam zamanlı alan uzmanı.
- AfterQuery [DOĞRULANDI]: Ocak 2025 kuruldu, YC. Nisan 2026 Series A 30M, 300M değerleme, Altos lider, Raine katıldı. 100M+ run-rate. ~100K doğrulanmış profesyonel (tıp, hukuk, finans). Terminal-Bench, VADER, IDE-Bench benchmark'ları. Uzman ücretleri 80-250 dolar/saat.
- Bespoke Labs [DOĞRULANDI]: 2024, Mahesh Sathiamoorthy ve Alex Dimakis. Toplam 40M (Series A Wing lider, seed 8VC; melekler Jeff Dean vd.), 6 Temmuz 2026 duyuru. "Araştırma laboratuvarı" konumlanması, uzun ufuklu ajanlar için ortam.
6. Rakip derinlemesine B: computer-use ve masaüstü veri startupları
6.1 Pazar şekli, tek paragraf
Kategori 2025-2026'da üç katmana ayrıldı. (a) Ortam kurucular: üretim yazılımını klonlayanlar (Deeptune, Chakra, Plato, Fleet, Refresh, Halluminate, Matrices, Scale), RL deterministik çalışsın ve verifier olsun diye. (b) İnsan verisi satıcıları: gerçek insanları gerçek yazılımda kaydedenler (Markov, Chakra'nın Pango'su, Huzzle, Turing/ServiceNow, Mercor ve Handshake kontratçı projeleri). (c) Altyapı ve model lab'leri: iki katmanı da ucuzlatanlar (Cua'nın çapraz-OS filoları; Standard Intelligence'ın 11M saatlik ekran videosunu inverse-dynamics ile etiketlemesi). Fiyatlama gücünü sıfırlayan iki olay: Mercor'un Deeptune'u satın alması (9 Temmuz 2026) ve Standard Intelligence'ın 75M Series A'sı (30 Nisan 2026). Birlikte söyledikleri: (i) uzman ağları ortamlara sahip olmak istiyor, (ii) internet videosu + otomatik aksiyon etiketi, ölçek katmanında elle kaydedilmiş saatlerin yerine geçebilir. Profesyonel CAD/EDA/3D, her benchmark'ta ajanların hâlâ başarısız olduğu tek alan (Snorkel Cua-Bench KiCad: sıfırdan kurma 0/16, 15 Haziran 2026). PixelNode tam orada oynuyor.
6.2 Karşılaştırma
| Şirket | Kuruluş, kurucular | Yatırım | Ne satıyor | Gerçek uygulama mı klon mu | İnsan demosu, nasıl | Fiyat sinyali | Müşteri | Lansman | PixelNode'un yakalaması veya geçmesi gereken |
|---|---|---|---|---|---|---|---|---|---|
| Markov (markovstudios.com, HF markov-ai) | 2026, SF; Dev Mandal (CEO, eski Sarvam, IIT Madras), Harish Ashok (CTO, eski Zenith robotik); 2 kişi [DOĞRULANDI, YC] | YC S26; fiyatlı tur yok | Uzman ekran kaydı + senkron fare/klavye + anlatım; problem tanımı, referans dosya, teslimat ve rubric içeren CAD iş akışı paketleri; CUA SFT verisi | Katkıcıların kendi makinelerinde gerçek lisanslı masaüstü uygulamaları; "CAD ortamları" (kayıt + rubric, çalıştırılabilir sim değil) | Evet. Kontratçı kaydedici, 30 FPS MP4, zaman damgalı girdi, kare bazında anlatım. AMA amiral gemisi computer-use-large (12.300 saat) "internetten toplanmış", ses silinmiş, sadece video | Kamuya açık değil; YC sayfasında 15.000+ saat satıldı, başlık 33.000+ olarak güncellendi; HF'de 150K+ indirme; cad-1000-hours (1.021 saat, 597 iş akışı) ayda 105.061 indirme | "Frontier lab'ler", isimsiz | HF'de açık veri seti, YC | Ücretsiz dağıtılan, anlatımlı, rubric'li, kaynak dosyalı CAD paketleri |
| Chakra Labs (chakra.dev, trydojo.ai) | 2024, Brooklyn; Alexander Fung (eski Palantir, Snap), Nirmal Krishnan; ~14 kişi | 10,1M, tek tur, SEC dosyası 26 Ocak 2026 | Dojo: deterministik piksel-mükemmel klonlar; 2.500+ saat insan trajectory'si, 10M ekran görüntüsü/aksiyon çifti | Sadece klon ("UI değişikliği, CAPTCHA, auth'tan kaçınır") | Evet. Pango: Chrome eklentisi, 180+ ülkede kitle kaynak, oturum uzunluğu ve kaliteye göre ödeme | Özel beta | "Önde gelen araştırma ekipleri" | Dojo Ekim 2025; "RL Environments are Worthless" (7 Ocak 2026) gibi aykırı yazılar; MAGI benchmark 10 Temmuz 2026 | 2.500 saat doğal iş trajectory'si + aynı UI'ın deterministik tekrarı |
| Huzzle Labs (labs.huzzle.com) | Londra; Ingmar Klein (CEO); Labs ~30 kişi | ~6M toplam; a16z Scout, Thomas Wolf | RL ortamları (coding, computer-use, kurumsal), uzman trajectory verisi, HuzzleWorld modelleri (2B, ScreenSpot-Pro'da 2B altı lider; 8B OSWorld #13) | Programatik grader'lı çalıştırılabilir dünyalar | Evet, 300K+ uzman ağı, 100K aylık aktif; kayıt aracı açıklanmıyor | Yok | Öz-iddia Apple, Lazard, FT; sitede Meta Superintelligence Labs alıntısı | SOC 2; Sifted İngiltere en hızlı büyüyen #7 (2026); Meta ile OpenEnv spreadsheet ortamı | Avrupa, SOC 2, 300K vetted uzman, GDPR-yerli |
| Matrices | 2023, SF; John Qian, Leonardo Setyanto | 5M seed, Index + AI Grant + Naval, Mart 2024 | "İnternetin oyunlaştırılmış replikası" | Klon, tarayıcı | Belgelenmemiş | Öz-iddia 7 haneli lab sözleşmeleri | İsimsiz | a16z 10 Ağustos yazısında anıldı | Masaüstü profesyonel yazılımla düşük örtüşme |
| Plato (plato.so) | 2025, SF; Robert Farlow, Pranav Putta (eski MultiOn); ~10 kişi | Pre-seed | Replika siteler + Python SDK ile "tam Linux masaüstü"; oturum, sim, mutasyon, puanlama | Klon + Linux masaüstü konteyneri | Belgelenmemiş | Liste fiyatı yok | Doğrulanmış müşteri yok | SDK dokümanları | Mutasyon takipli, puanlamalı durumlu sim API'si |
| Halluminate | 2024, SF; Jerry Wu, Wyatt Marshall; 5-10 kişi | YC S25 | IB/PE/danışmanlık için RL ortamları; Westworld; Web Bench (~2,5K görev); Finance Diligence Bench (88 problem, "dinamik masaüstü ortamları") | Klon + masaüstü | Kurumlardan gerçek deal-room verisi lisanslıyor, anlaşma başına 6-7 haneli [RAPOR] | Yok | Öz-iddia OpenAI, Anthropic | Sim-to-real yazısı 27 Temmuz; Finance Diligence Bench 11 Ağustos 2026 | Dikey derinlik: masaüstü ortamının içinde gerçek anonim deal verisi |
| Cua (cua.ai) | 2025, SF; Francesco Bonacci; 3 kişi | YC X25; 500K (468 Capital vd.), Temmuz 2025 | Cua Driver (açık kaynak, 22 Nisan 2026), Sandbox (Docker/QEMU/Apple VZ), Fleets (sıcak havuz), Cua-Bench (130 görev, 42 ortam, 5 platform), "Verified Data" (insan incelemeli altın trajectory'ler) | Gerçek OS konteyner/VM, klon değil | Ajan rollout'ları + insan incelemeli altınlar; uzman kaydedici ürünü yok | 0,044625 dolar/vCPU/saat, 0,0223 dolar/GB/saat; MIT, 22,2K yıldız; SOC 2 Type I | Ekosistem ortağı olarak OpenAI, Qwen Code, Factory Droid, H Company | GitHub öncelikli; Computer-Use 2.0 yazısı 13 Temmuz 2026 | Saatte kuruşlarla emtia çapraz-OS bulut masaüstü + kamuya açık profesyonel yazılım benchmark'ı |
| Deeptune | ~Mart 2025, NYC; Tim Lupo; eski Anthropic, Scale, Palantir, Modal, Glean, Retool, Hebbia | 43M Series A a16z, 19 Mart 2026; Noam Brown, Foody, Yash Patil melek; Mercor 9 Temmuz 2026'da aldı | Slack, Salesforce, Excel'i taklit eden "yüzlerce gym"; task + verifier | Klon | Satın alma öncesi belgelenmemiş; şimdi Mercor'un uzman ağıyla | Yok | Frontier lab'ler | a16z turu, sonra M&A | Tek 10 milyarlık çatı altında ortam + uzman + lab dağıtımı |
| Veris AI | Mehdi Jamei, Andi Partovi | 8,5M seed, Decibel + Acrew, 3 Haziran 2025 | Ses, chat, tool-calling ve coding ajanları için üretim ikizi simülasyonlar; RFT | API sim, GUI değil | Hayır | VPC/on-prem; SOC 2 Type II, HIPAA, GDPR | Finans, üretkenlik, imalat | Basın + marketplace | Düşük örtüşme; uyum duruşu çıta |
| Refresh | 2025, SF; Christopher Settles (eski Uber AI), Erik Quintanilla; 8 kişi | YC X25 | "Computer use yazılım dünyaları" (birbirine bağlı uygulama klonları), SWE, MCP gym'leri | Web içeriğini arşivleyerek klon | Mühendislerden gerçek başarısız görevler; kaydedici yok | Yok | Frontier lab'ler | YC; Scale'in tekliflerini reddettiği rapor ediliyor | Frontier modellerin başarısız olduğu görevleri kaynaklamak |
| Originator | Bilinmiyor | Bilinmiyor | "Powering Computer Use"; a16z altyapı satıcısı olarak saydı | Sitesi 6 Temmuz 2026 tarihli tek satırlık placeholder | [DEDİKODU] Doğrulanabilir bir şey yok | ||||
| Vetto AI | Kasım 2024, Brezilya; Lucas Smaira; eski DeepMind, Meta, Mistral | Açıklanmadı; "zaten karlı" | Uzman yazımı eval görevleri; "Computer Control" terminal sandbox, onaylı görev başına R$1.500 | Mock OS/terminal, GUI değil | Uzmanlar task yazıyor, ekran kaydı yok | Uzmana 300 dolar/saate kadar | OpenAI, Anthropic [RAPOR] | Yetenek ağı basını | GUI tehdidi değil; LatAm maliyet tabanı |
| Collinear | 2023, Sunnyvale; Nazneen Rajani (eski HF) | Açıklanmadı; B Capital, Storm, Hitachi | Simulation Labs; OSWorld-Verified, CWE-Bench, MCP-Atlas; "500B+ token ajan eğitim verisi" | Kurumsal araç klonları, "%90 fonksiyonel sadakat" | Belgelenmemiş | SOC, ISO 42001 | "Önde gelen frontier lab'ler" | Benchmark + araştırma markası | Araştırmacı kredibilitesi ve verifier kütüphaneleri |
| Standard Intelligence (si.inc) | SF; Galen Mead (21), Devansh Pandey (20); 6 kişi | 75M Series A, Sequoia + Spark, Karpathy melek, 30 Nisan 2026 | FDM-1 computer-action modeli (23 Şubat 2026), veri ürünü değil | Vahşi ortamdan gerçek ekran videosu | 40.000 saat kontratçı etiketli kayıtla inverse dynamics modeli eğitti, sonra 11M saatlik ekran kaydı külliyatını 30 FPS'te otomatik etiketledi; külliyat kaynağı açıklanmadı [muhtemelen internet videosu] | Araştırma blogu + a16z atfı | Etiketsiz videodan aksiyon etiketi çıkarılabileceğini açık verinin 550.000 katı ölçekte kanıtladı | ||
| Simular | Ağustos 2023, eski DeepMind; Ang Li | 21,5M Series A, Felicis + NVentures, 2 Aralık 2025 | Özel bulut masaüstünde Sai ajanı; açık Agent S | Uzak filoda gerçek OS | Veri satıcısı değil | Tüketici; 12.653+ kullanıcı | Son kullanıcı | 28 Ağustos 2026: OSWorld 2.0 %73,0 kısmi, binary sadece %28,25, 15,70 dolar/task. Tavanı gösteriyor: saatlik görevlerde %28 tam tamamlama, lab'ler hâlâ uzman verisine muhtaç | |
| Snorkel Cua-Bench (KiCad) | Snorkel + Cua, 15 Haziran 2026 | 25 uzman yazımı KiCad şematik görevi, netlist doğrulamalı | Cua konteynerinde gerçek KiCad | Pratisyen EE'ler yazdı, akran incelemeli, ~50 insan adımına kalibre | Kamuya açık | Benchmark + blog | Mühendislik artefaktları için doğrulanabilir ground truth (netlist) |
6.3 İşgücü piyasası ve incumbent sinyalleri
- Mercor CAD Engineer, "ScreenSpot Plus" [DOĞRULANDI, work.mercor.com, ~Haziran 2026]: 70-90 dolar/saat, uzaktan ABD/Kanada, Stripe/Wise ile haftalık ödeme, pilot sonra üretim. Teslimat: "gerçekçi uzman iş akışları sırasında" AutoCAD, SolidWorks, Fusion 360, CATIA, Revit veya NX ekran görüntüleri, UI öğelerine bounding box, doğal dil task talimatı. İsim ScreenSpot-Pro tarzı profesyonel uygulama grounding veri setine işaret ediyor. Kontratçılar kendi lisanslı yazılımlarını getirmek zorunda; GPU bulut masaüstünün kapattığı boşluk tam bu. Mercor 3D Artist (kapandı): 24-60 dolar/saat, haftada 20 saat minimum, Houdini, Blender, Substance, ZBrush, Maya, Unity, 3ds Max, Unreal'da 3D asset anotasyonu inceleyen kıdemli sanatçılar.
- Handshake AI CAD Tool Specialist [DOĞRULANDI, 5 Eylül 2026]: 125 dolar/saate kadar, prompt ve LLM cevabı değerlendirme (kayıt değil); 95 Handshake ilanının ortalaması 108 dolar/saat. 70-125 dolar/saat, PixelNode'un CAD uzmanlarına ödemesi gereken tabanı belirliyor.
- Turing x ServiceNow UI-Vision [DOĞRULANDI, arXiv 19 Mart 2025, ICML 2025]: 83 masaüstü uygulaması, öğe ve layout grounding + aksiyon tahmini, CC BY-4.0; mühendislik/veri bilimi dereceli anotatörler, ağırlıkla Hindistan ve LatAm, çok aşamalı SME incelemesi. "BPO seviyesi" masaüstü demosunun şablonu: ucuz, geniş, sığ.
- Scale AI RL Environments [DOĞRULANDI, 27 Şubat 2026]: web uygulamaları, macOS/Windows benzeri masaüstü VM'leri, MCP sunucuları, uzman küratörlü artefaktlar, süreç ve sonuç verifier'ları, pass@k karmaşıklık analizi.
- Surge CoreCraft [DOĞRULANDI, arXiv 18 Şubat 2026]: 2.500+ varlık, 23 araç; frontier modeller tam rubric'te %30 altı; GRPO ile GLM 4.6 %25,4'ten %36,8'e. Araç bazlı, GUI değil, ama incumbent'ların ortam ROI'sini nasıl kanıtladığının referansı.
6.4 Kesişen bulgular
- Neredeyse herkes klonluyor; neredeyse hiç kimse gerçek lisanslı profesyonel yazılımı kaydetmiyor. Sadece Markov (kendi makinelerinde), Cua/Snorkel (konteynerde KiCad) ve Mercor'un kontratçı projeleri gerçek CAD/3D binary'sine dokunuyor. Kimse kamuya açık olarak lisanslı AutoCAD, SolidWorks, Revit, Maya veya Substance'ı rızalı kaydediciyle bulut GPU masaüstünde sunmuyor.
- Markov'un manşet ölçeği çoğunlukla uzman kaydı değil. ~13.300 açık saatinin 12.300'ü internet kaynaklı, sesi silinmiş, girdi olayı olmayan video. Uzman kayıtlı, anlatımlı, rubric'li CAD seti ~1.022 saat. "33.000+ saat satıldı" denetlenmemiş ve internet kaynaklı materyali içeriyor olabilir. En önemli tek diligence bulgusu: pazar liderinin kökeni karışık.
- Inverse dynamics tehdidi gerçek ama sınırlı. Standard Intelligence IDM'ini bootstrap etmek için 40.000 saat kontratçı etiketli kayda ihtiyaç duydu. Lab'ler zor alanlarda (CAD, EDA, DCC) etiketleyicileri eğitmek ve doğrulamak için yüksek kaliteli etiketli saat almaya devam edecek; kazınmış video hukuki inceleme çektikçe rızalı, lisans-temiz köken daha değerli olur.
- Profesyonel yazılım performansı açık yara. Cua-Bench KiCad (%16 geçiş, sıfırdan %0), OSWorld 2.0 binary %28 (Simular, 28 Ağustos 2026), Huzzle'ın kendi computer-use skoru %22,5. Alıcılar bu sayıları oynatan veriye ödeyecek.
- Fiyat Cua dışında her yerde opak. Tek kamu rakamı Cua'nın sandbox fiyatı. Veri saat veya task başına NDA altında satılıyor; Mercor'un 70-90 ve Handshake'in 125 dolarlık kontratçı ücretleri, QA ve marj eklenince teslim edilmiş CAD verisinin saat başı 150-300+ dolara mal olduğunu ima ediyor [çıkarım].
- Konsolidasyon başladı. Mercor, a16z'nin 43M'lik turundan dört ay sonra Deeptune'u aldı; Sepal Şubat'ta katlandı. 12 ay içinde Scale, Surge, Handshake veya Turing'in bir ortam dükkanı alması beklenir [DEDİKODU].
6.5 En tehlikeli beş rakip ve neden
- Mercor (Deeptune ile). Zaten 70-90 dolar/saatlik CAD ekran görüntüsü ve anotasyon projesi, 3D sanatçı anotasyon programı ve sektörün en büyük uzman havuzu iddiası var; şimdi bir ortam platformuna da sahip ve 2 milyar ARR ile 10 milyar değerleme, bir bulut masaüstü kaydedicisini sübvanse etmeye yeter. Zayıflığı: kontratçılar kendi lisanslı yazılımlarını getirmek zorunda, bu derinliği ve kökeni sınırlıyor. Mercor lisanslı bulut iş istasyonu kurarsa PixelNode'un farkı kalite ve rıza hijyenine iner.
- Markov. En doğrudan kafa kafaya rakip: aynı pitch, aynı uygulamalar, anlatım + girdi olayı + rubric + teslimat, ve CAD paketinde ayda 100K+ indirme üretmiş açık-veri-öncelikli GTM. YC S26'da fiyatlı turu olmayan iki kişi; altyapı, lisans uyumu ve kökende yenilebilir; PixelNode de yayınlamazsa dağıtım hızında yenilemez.
- Standard Intelligence. Satıcı değil, talep yıkıcı. FDM tarzı inverse-dynamics etiketleme lab varsayılanı olursa, ham kayıtlı saat pazarı etiketleyici eğitmek için gereken on binlerce saate doğru küçülür ve alıcılar "YouTube'un bedava verdiğine neden uzman ücreti ödeyelim" diye sorar. PixelNode'un cevabı: doğrulanabilir rıza, lisans-temiz profesyonel yazılım ve video kazımanın veremeyeceği rubric'li teslimatlar olmalı.
- Scale AI (Surge, Handshake ve Turing aynı tehdit sınıfı). Masaüstü VM'leri ve MCP ortamları, uzman küratörlü artefaktlar ve verifier'lar, her lab ilişkisi, yeni projelerin yarısı RL ortamı. Handshake bugün CAD uzmanına 125 dolar ödüyor. Bu incumbent'lar lisanslı iş istasyonu programını zarar lideri olarak fonlayabilir; PixelNode fiyatla değil alan derinliği ve hızla kazanmalı.
- Cua (alternatif olarak Chakra). Substratı emtialaştırıyor: saatte kuruşlarla çapraz-OS sıcak havuz masaüstü, MIT sürücü, Snorkel ile kamuya açık profesyonel yazılım benchmark'ı, filizlenen "Verified Data" hattı. Bir lab Cua filosu kiralayıp kendi lisanslarını kurup Mercor kontratçısı tutarak PixelNode'u parçalardan yeniden kurabilir.
Net: PixelNode'un savunulabilir konumu, beşinin de bugün işgal etmediği kesişim: GPU bulut masaüstünde lisanslı yaratıcı/mühendislik binary'leri, anlatımlı ve artefaktlı rızalı uzman kaydı, ve aynı oturumlardan türetilen çalıştırılabilir ortamlar. Pencere: Mercor veya Scale'in lisanslı bulut iş istasyonlarının capex'e değdiğine karar vermesinden önceki 6-12 ay.
Kaynaklar: Markov, Markov YC, Markov computer-use-large, Markov cad-1000-hours, Chakra Dojo, Chakra Pango, Huzzle, Plato docs, Halluminate blog, Cua, Cua-Bench KiCad, Deeptune Series A, Mercor/Deeptune, Mercor CAD ilanı, Handshake CAD, Standard Intelligence FDM-1, Sequoia SI, Simular OSWorld 2.0, Snorkel Cua-Bench, UI-Vision, Scale RL Environments, Surge CoreCraft.
Ön veri:
- Markov: uzman computer-use verisi, 33K+ saat satıldı, HF'de 200K+ indirme. Doğrudan Capture Suite rakibi.
- Chakra Labs: deterministik piksel-mükemmel klonlar + CUA trajectory setleri, ~10M yatırım.
- Huzzle Labs: uzun ufuklu ortamlar, uzman trajectory'leri, 300K uzman ağı, SOC 2 Type II, Avrupa kurumsal odak, 6M.
- Cua (trycua): YC X25, MIT lisanslı açık kaynak, macOS/Linux/Windows sandbox, SDK, cua-bench, Lume sanallaştırma, trajectory export, Cua Cloud. Environment Suite'in ücretsiz versiyonu.
- Deeptune: Mart 2026'da 43M Series A (a16z), Temmuz 2026'da Mercor satın aldı. Yüzlerce Slack ve Salesforce benzeri gym.
- Plato: web replikaları + tam Linux masaüstü. Matrices: "internetin oyunlaştırılmış replikası", 5M Index. Halluminate: finansal hizmetlere daraldı, YC S25.
- Alignlist listesinde computer-use etiketli: Cua, Habitat, Originator, Refresh; insan trajectory: Trajectory Labs. Pavlov's List'te masaüstü/trajectory bayraklı: Turing, AfterQuery, Abundant, BenchFlow, Cua, Markov, pre.dev, Tacit Labs, Deeptune, Chakra, Originator, Plato, Refresh, Sepal, Vetto AI.
7. İnsan verisi devleri ve uzman tedarik ekonomisi
7.1 Satıcı bazında güncel sayılar
| Satıcı | Brüt run-rate (tarih) | Net / marj | Değerleme ve son tur | Uzman ağı iddiası | Lab payı | Haziran-Eylül 2026 |
|---|---|---|---|---|---|---|
| Mercor | 2,0 milyar (Haziran 2026); H1 2026 614M brüt [RAPOR] | Kontratçı %60-70 alıyor; H1 net 180-250M; H1 2025 6M FCF karı | 10 milyar (Ekim 2025, 350M Series C, Felicis); ~500M için 20 milyar term sheet [RAPOR, TechCrunch 9 Temmuz] | 30K+ haftalık aktif, 300K havuz, pazarlamada "5M+ uzman" | ~%91 lab, esas OpenAI ve Anthropic | Sepal (6 Şubat), Deeptune (9 Temmuz); 2026 başı LiteLLM tedarik zinciri ihlali, Meta işi durdurdu, beş kontratçı davası [RAPOR, Sacra] |
| Surge AI | 1,2 milyar (2024); Latka 2025 tahmini 1,4 milyar [RAPOR/DEDİKODU] | Bootstrap, 2021'den beri karlı | ~1 milyar için 25+ milyar görüşmesi, JPM ikincil, a16z/Warburg/TPG [RAPOR, Bloomberg]; Eylül itibarıyla kapanış duyurusu yok | ~50K kontratçı | ~12 frontier lab 1 milyar+ getiriyor | EnterpriseBench CoreCraft makalesi Şubat, blog 18 Temmuz; Kaliforniya yanlış sınıflandırma davası |
| Scale AI | ~870M (2024); "1 milyarın hemen altı" [RAPOR] | Kurumsal uygulamalar 200M yıllık, 18 ayda etiketlemeyi geçmesi bekleniyor | 29 milyar (Meta %49 için 14,3 milyar, Haziran 2025); Meta 5 yıl boyunca en az 450M/yıl taahhüt | Outlier ağı, boyut açıklanmıyor | Meta sonrası Google (~150-200M), OpenAI, Microsoft, xAI gitti | CEO Droege 2026 için "1 milyarı aşar" (15 Mayıs); RL Environments ürünü Şubat 2026, "yeni projelerin yarısına yakını RL ortamı içeriyor" |
| Handshake AI | ~1,0-1,1 milyar brüt (Nisan 2026; Ocak'ta 550M) [RAPOR] | ~300M net; "yarısı veya fazlası uzmana" | 3,5 milyar (Series F, Ocak 2025); 2026 turu bulunamadı | Kimlik grafiğinde 500K doktora adayı, 3M yüksek lisans | "esasen her frontier model üreticisi" | Uplimit'i 30 Haziran 2026'da satın aldı (AI beceri akademisi) |
| micro1 | 500M brüt (20 Ağustos 2026; sekiz ay önce 100M) [RAPOR] | Net 150-200M; hazır sentetik veride %80-90 brüt marj | 500M Series A (Eylül 2025); "önemli ölçüde yüksek" değerlemeyle yeni tur [DEDİKODU] | Zara "sadece ilk %1'i geçirir" | Lab + kurumsal; Çin lab'lerine satmıyor | Ürünler: Realm (RL ortamları), Cortex (üretim değerlendirme), Robotics |
| Turing | 300M ARR, karlı (2024); 2026 rakamı yok | 2,2 milyar (Series E 111M, 2025) | "milyonlarca" mühendis (pazarlama) | UI-Vision, ServiceNow ile, 83 masaüstü uygulamasında 10K+ görev (Aralık 2025). "1.000+ UI ortamı" iddiası hiçbir kaynakta bulunamadı [DEDİKODU] | ||
| AfterQuery | 100M ARR (Nisan 2026) | 30M @ 300M (Nisan, Altos); 1 Eylül 2026: TechCrunch'a göre 3,2 milyar, YC'nin en hızlı unicorn'u [RAPOR] | "her ABD frontier lab'i" + Nvidia, Legora, Motif | |||
| Toloka | açıklanmıyor | 72M (Bezos Expeditions, Mayıs 2025); Nebius çoğunluk | "milyonlarca katılımcı" | Amazon, Microsoft, Anthropic, Shopify | Shopify vaka çalışması 4 Eylül; self-serve "Exams" 18 Ağustos | |
| Invisible | 134M (2024) | ~%11 EBITDA | 2 milyar+ (100M, Vanara, Eylül 2025) | 350 FTE, 35 ülkede 3K+ ajan | OpenAI, Amazon, Microsoft, Cohere, DoorDash | WeCP satın alımı Mart 2026 |
| Pareto | ~61M tahmini [DEDİKODU] | "ilk %0,01 uzman" | Anthropic, Character.AI, Imbue | LEAPBench, AttuneBench (Mayıs-Haziran) |
Pazar yapısı: Scale, Surge, Mercor, Handshake tahmini ~8,5 milyarlık pazarın %75+'ını alıyor [DEDİKODU, X kaynaklı harita via Pebblous].
7.2 Birim ekonomi
- Take rate: brüt raporlayan her pazar yeri %30-40 tutuyor. Mercor kontratçıya %60-70; micro1 aynı; Handshake ~1 milyar brütte ~300M net. Surge ve Scale net raporluyor (lab'e doğrudan fatura, kontratçı COGS), bu yüzden 1 milyar+ rakamları Mercor'un 2 milyar brütüyle kıyaslanamaz.
- Lab tarafı fiyat: kredili uzman saati 85-200+ dolar; kontratçıya 100-200 öncesi %30+ satıcı markup'ı [DEDİKODU, toplayıcı]. Basit UI gym ~20K, karmaşık uygulama ortamı 300K'ya kadar.
- Ürün karması: hiçbir satıcı ortam vs RLHF vs eval kırılımı vermiyor. Sinyaller: Scale "yeni projelerin yarısına yakını RL ortamı" (Şubat 2026); Mercor'un iki satın alımı da ortam şirketi ve Applied Compute 50 dünyada 874 Mercor görevi ile eğitti (24 Şubat 2026); Surge ortamları araştırma ürünü olarak konumluyor. Çıkarım: ortam ve ajan eval büyüme motoru, RLHF hacim tabanı; bu yüzden kıdemli uzman ücretleri yükselirken jeneralist ücretler düşüyor.
7.3 Alan ve satıcıya göre uzman ücretleri (2026)
| Segment | Handshake | Mercor | Surge / DataAnnotation | Scale / Outlier | Alignerr |
|---|---|---|---|---|---|
| STEM doktora | 75-125, küme 90-100 | 90-120 mod | 50-100+ listelenmiş; 25-45 raporlanan | 35-60 uzman katmanı | 25-45 |
| Kıdemli uzman (MD, M&A avukatı, eski bankacı) | 300'e kadar; 175-300 | 175-250+ | Tıp fellow 250-450, VC ortağı 500-1.000 | Hukuk 100'e kadar | Finans/ML 150 |
| Jeneralist RLHF | ~30 | 25-80 listelenmiş; Meta video projesinde 16-21 | 14-20 raporlanan vs 25-30 listelenmiş | 15-22, 2023'te 40-50'ydi | 15-25 |
| Yaratıcı | 18-250; tipik 60-120 | yok | |||
| CAD / makine | 125'e kadar (AutoCAD Mechanical, Rhino, Inventor; prompt yazma ve LLM cevabı değerlendirme, ekran kaydı değil) | 50 (task yazma), 70-90 (CAD yazılımında gerçekçi iş akışı sırasında ekran görüntüsü çekme, UI öğesi anotasyonu, task talimatı yazma: açık UI-trajectory toplama) |
7.4 Yaratıcı ve mühendislik alanında kim ne yapıyor
- Mercor en geniş yaratıcı toplayıcı: Senior Design Expert (150-250), Film/VFX/Animasyon Görsel Kalite Uzmanı, Karakter ve Yüz Animasyonu Danışmanı, Grafik ve UX/UI, müzik prodüksiyon (18-65), "3D Artist / 3D Generalist / Technical Artist" anotasyon projesi, 40 dolar/saat Video Editör ilanı. İş: değerlendir, kriter yaz, test et, incele. CAD Engineer ilanı ise açıkça ekran görüntüsü toplama.
- Handshake CAD Tool Specialist 125'e kadar; iş prompt yazma ve değerlendirme, ekran kaydı değil (sayfa 5 Eylül 2026 tarihli).
- Turing UI-Vision: anotatörler GIMP ve VS Code dahil 83 uygulamada görevleri yaptı ve kaydetti; ekipler Hindistan ve LatAm.
- micro1 robotik yakalama: "yüzlerce jeneralist evdeki nesne etkileşimlerini kaydediyor".
- Scale, Surge, Alignerr, AfterQuery: yaratıcı veya CAD rolü bulunamadı. Mimar ilanı hiçbir satıcıda yok.
Çıkarım: yaratıcı ve CAD araçlarında ekran kaydı ile profesyonel iş akışı, bugün yalnızca Mercor, Turing ve (robotikte) micro1'de canlı bir SKU. Diğerlerinde yaratıcı iş çıktı değerlendirmesi. Boşluk gerçek ama Mercor zaten el yordamıyla dolduruyor.
7.5 Ortam stratejileri
Mercor: platform satın al, uzmanla besle (Sepal, Deeptune; "ortam hizmeti"; APEX-Agents; Applied Compute hem müşteri hem ortak). Surge: içeride kur, araştırma olarak yayınla (CoreCraft: 2.500 varlık, 23 araç, GRPO ile GLM 4.6'yı %25'ten %37'ye; Vercel AI SDK ve MCP). Scale: ürünleşmiş RL Environments (Şubat 2026): web uygulamaları, macOS/Windows benzeri masaüstü VM'leri, Slack/HubSpot/Linear için MCP sunucuları, uzman küratörlü artefaktlar, otomatik verifier, pass@k. Turing: Jira, Salesforce, Zendesk UI replikaları + backend API ortamları. Handshake: ortam ürünü yok, grader modelleri için 20 doktora. micro1: Realm, Cortex, Robotics. Toloka: exam kapılı ajan pipeline'ı, Shopify judge-distillation.
7.6 White-label ve ortaklık davranışı
Kanıt: Mercor lisanslamak yerine satın aldı (Sepal, Deeptune); ödeme Stripe ve Wise; uyum için Delve. Surge tamamen dahili. Handshake Deel ve Stripe; Uplimit'i satın aldı. Invisible WeCP'yi satın aldı. Alignerr tersi örnek: araç şirketi (Labelbox) kendi uzman ağını çalıştırıyor. Toloka self-serve ve müşteriyle ortak kurma (Shopify). Turing UI-Vision'ı ServiceNow ile birlikte kurdu, yakalama ve anotasyon emeğini sağladı. Üst kademe bir satıcının üçüncü taraftan yakalama veya ortam platformu lisanslayıp yeniden sattığı hiçbir örnek bulunamadı. Desen: küçük (50M altı yatırım almış) araç ekiplerini satın al veya içeride kur; görünen tek "lisanslama" ödeme, proctoring ve uyum gibi emtialar.
7.7 Yoğunlaşma ve kayıp
Mercor H1 2026 brütünün ~%91'i lab'lerden. Surge'de ~12 lab. Scale Meta sonrası Google, OpenAI, Microsoft, xAI'ı kaybetti; devlet (500M Thunderforge, Golden Dome) ve kurumsala döndü. Anthropic ortam harcamasını 12+ satıcıya yayıyor. Lab'ler çıkar çatışması (Scale/Meta) veya güvenlik (Mercor ihlali) tetikleyicisinde aylar içinde dokuz haneli bütçeleri taşıyabiliyor.
7.8 Teknoloji-öncelikli bir tedarikçi bu satıcılara nasıl konumlanmalı
- Onlar araç lisanslayan değil ekip satın alan alıcılar. Stratejik önem kazanan araç startup'ına lisans değil satın alma teklifi gelir. Her kanal anlaşmasını bu çıkışı düşünerek fiyatla, veri ve IP haklarını elinde tut.
- Kendi içlerinde dolduramadıkları dikiş, otantik profesyonel araç trajectory'leri. Mercor CAD ekran görüntüsüne 70-90, video editörüne 40 ödüyor; Turing 83 açık kaynak uygulamada Hindistan ve LatAm anotatörlerine güveniyor; Handshake'in CAD işi sadece metin. Blender, Premiere, SolidWorks, Revit'te doğrulanmış profesyonel iş akışını verifier'la ölçekli yakalayan platform, üçünün de elle yaptığı bir emek ve araç sorununu çözer. Mercor, Turing ve micro1 doğal ilk kanal alıcıları, çünkü bu SKU'yu zaten satıyorlar.
- Surge ve Scale rekabet edecek. Yeniden satmazlar, kopyalarlar. Gerçek araç verisi sadakati ve uzman kökeni üzerinden rekabet et, ortam iskelesi üzerinden değil.
- Lab'lere paralel doğrudan sat. Anthropic 12+ satıcı kullanıyor, AfterQuery 18 ayda doğrudan satarak 100M ARR ve 3,2 milyar değerlemeye ulaştı. Satıcıların %30-40 payı, doğrudan ilişkinin geri kazandığı marj.
- Aracılıktan çıkarılan katman olmaktan korun. Ödeme, proctoring, uyum emtia fiyatlanıyor; sadece "kaydedici" gibi görünen platform emtia fiyatlanır. Uzman arzını, verifier'ları ve alan rubriğini teknolojiyle paketle ki satıcı bir veri ürünü görsün.
Pratik duruş: Mercor, Turing, micro1 ile yaratıcı ve CAD trajectory verisi için münhasır olmayan kanal pilotları; eş zamanlı Anthropic ve OpenAI doğrudan hattı; Surge ve Scale'i sadakat çıtasını belirleyen rakipler olarak izle.
Kaynaklar: Sacra Mercor, TechCrunch Mercor 20 milyar, Sacra Surge, Bloomberg Surge via Investing, Scale 2026 rehberi, Scale RL Environments, Sacra Handshake, Handshake/Uplimit, TechCrunch micro1, micro1 ürünler, Turing UI-Vision, TechCrunch AfterQuery 3,2 milyar, Applied Compute x Mercor, Surge CoreCraft, Handshake CAD, Mercor creative, Contrary Mercor, aitraining.jobs ücretler, Pebblous oligopol.
Ön veri, doğrudan çekilen:
- Mercor [DOĞRULANDI, Contrary + Sacra]: Şubat 2025 75M ARR, Ekim 2025 450M, Haziran 2026 2 milyar brüt, H1 2026 614M brüt. Kontratçı ortalama 85 dolar/saat, bazı uzmanlar 200. Take rate saatlikte ~%35 markup. Günde 1,5M+ ödeme, 30K+ kontratçı (Ekim 2025). AI ile 20 dakikalık video mülakat. Sepal (Şubat 2026) ve Deeptune (Temmuz 2026) satın alımları. Archipelago açık kaynak değerlendirme harness'ı. APEX, ACE, APEX-Agents benchmark'ları. ~50 çalışan. Ekim 2025 toplu dava: bağımsız yüklenici sınıflandırması, izleme yazılımı ve ücret ihlalleri iddiası. Uzmanları Insightful ile izliyor (periyodik ekran görüntüsü). Değerleme ~22x gelir.
- Uzman ücretleri platform bazında (aitraining.jobs, Temmuz 2026): micro1 10-95 (frontier ML 200'e kadar), Mercor 75-200+, AfterQuery 80-250, Handshake 17-125, Surge 18-140 genel ve tıp/finans 250-500, Fleet 50-200, Turing 15-150, Invisible 6-65, Pareto 35-60, Prime Intellect ortam başına 100-500. Medyan 60 dolar/saat. Yaratıcı roller: video editörü AI trainer ilanı 8-65 dolar/saat.
- Tam zamanlı ortam mühendisi maaşları (Ağustos 2026): Anthropic Environment Scaling 350-850K, Code RL/Universes 500-850K, Mechanize 350K + hisse, xAI 180-600K. Kontrat: xAI 100-200/saat, tipik 15,5-27K/ay. Beklenen verim: mühendis başına ayda 15-20 cilalı task.
8. VC tezleri, şüpheciler, değerlemeler, M&A
8.1 En büyük fonlar ne diyor (2026)
- a16z, "Can agents use a computer yet? We've got the data" (10 Ağustos 2026) [DOĞRULANDI]: OSWorld-Verified 2025 başında %42'den Haziran 2026'da %85'e, insan tabanı ~%72; model artık kısıt değil. Ajan maliyeti 6-8 dolar/saat (3-15 aralığı), offshore BPO ~10, ABD back office 30-45; ama ajanlar 3-4 kat yavaş. Dağıtım ölçekleri: bir operatör ayda "milyonlarca otomatik görev", bir global SI 27 iş akışında günde 1.500-2.100 IT bileti, bir CPG platformu ayda 15-20M portal etkileşimi. Ortam/veri satıcıları: Mechanize, Habitat, Fleet, Chakra, Deeptune, Matrices, Originator; artı Standard Intelligence'ın 11M saatlik ekran videosu. Anahtar cümle: "Model artık ana darboğaz değil ve kalıcı avantaj yığında yukarı taşınıyor: bağlam, izinler, süreç bilgisi, doğrulama, eskalasyon, hata yönetimi, önbellek." Başarısızlık modları: çapraz kontrol edilemeyen görevler ve çalışma anında başarı sinyali olmayan görevler. a16z ortamları girdi, doğrulama ve ground truth'u değerin biriktiği yer olarak görüyor.
- Sequoia, Brendan Foody podcast (4 Eylül 2026) [DOĞRULANDI, kurucu kaynaklı sayılar]: çerçeve dünyalar (doküman, mesaj, tablo), uygulamalar (Salesforce, ServiceNow, M365'in MCP/CLI/UI ile erişilen yüksek sadakatli klonları), görevler (prompt + rubric veya unit test verifier). Sayılar: Q2'de 2,5M uzman saati; task fiyatı 50-10.000 dolar; 150 dolar/saat referans; 1.800 görevlik hukuk ortamı + ~500K post-training compute, kurumsal hukuk geçiş oranını %4,7'den %26,6'ya çıkardı. İçeri alma hakkında: "on farklı lab'in hepsinin kendi veri setini kurması mantıklı değil." Hendek: kurumsallar "kendi zekâlarına sahip olur", veri "çoğu zaman en ayırt edici faktör". Mercor'un dağıtım tezi: ortamlar lab'lerden Harvey, Sierra, Cognition'a yayılır.
- Sequoia, Standard Intelligence (30 Nisan 2026): 75M Series A (Sequoia + Spark). Tez: "computer use üzerinde tam video ön-eğitimi, çünkü aksiyon verisini gerçekten ölçekleyebilen tek yaklaşım." 11M saati insan anotatör değil inverse dynamics modeliyle etiketliyor. Uzman masaüstü kaydına doğrudan rakip tez.
- Lightspeed ve General Catalyst, Luel (15 Mayıs 2026): 31,2M seed; 96 ülkede 500K katkıcı; ~85 dolar/saat uzman ücreti. Tez: gelecek modeller "kazınmış değil toplanmış ve lisanslanmış veriyle" eğitilir; "rıza ve köken kayıtlarıyla" hak temizliği ürün özelliği, uyum sonradan düşüncesi değil.
- Kleiner Perkins: Applied Compute'un 80M @ 1,3 milyar turuna liderlik (Nisan 2026). Index: Matrices. General Catalyst: Modal, Prime Intellect, Good Start Labs. Benchmark: Mercor yatırımcısı.
- NEA, "The AI Neolab Wild West" (17 Haziran 2026) [GÖRÜŞ]: "Ortamın sahibi veri çarkının sahibidir"; verifier'lar "bu yığındaki en hafife alınan varlık"; insan etiketli veri açıkça ortamsal ödüle göre ikincil. NEA, tescilli külliyat, RL döngüsü ve alan verifier'ı olan gelir-öncesi neolab'lere 50-500M yatırıyor.
- Chris Barber, Pavlov's List (5 Eylül 2026 güncellemesi): 60+ şirket, kategorize. Epoch'tan JS Denain ile 18 mülakattan kurulmuş; Barber intro aracılığı yapıyor, John Schulman'ın "faydalı" bulduğunu not ediyor. Lab'lerin kullandığı alıcı tarafı dizini. Computer-use girişleri: Cua, Markov, Chakra, Originator, Refresh, Vetto, Plato.
8.2 Değerlemeler ve çarpanlar
| Şirket | Değerleme (durum, tarih) | Gelir tabanı | İma edilen çarpan |
|---|---|---|---|
| Mercor | 20 milyar görüşmesi, ~500M tur [RAPOR, 9 Temmuz]; Nvidia hisse araştırıyor [RAPOR, 19 Ağustos] | 2 milyar brüt ARR; ~%35 take; H1 614M, %91 lab; brüt marj 2025'te %27, Q2 2026'da %33, 2027 projeksiyonu %46 | ~10x brüt; ~29x net |
| Surge | 25+ milyar görüşmesi [RAPOR, Bloomberg]; kapanış yok | 1,2 milyar 2024; ~1,4 milyar run-rate | ~18x, nete yakın gelirde |
| micro1 | ~2,5 milyar teklifler [RAPOR, 20 Ağustos]; son fiyat 500M Eylül 2025 | 500M brüt; net 150-200M | ~5x brüt; ~13-17x net |
| Fleet | 725M post, 45M A [RAPOR, 1 Haziran] | ~60-63M run-rate; 160M ileri | ~12x cari; ~4,5x ileri |
| AfterQuery | 3,2 milyar [RAPOR, 1 Eylül] | 100M+ (Nisan); brüt/net açıklanmadı | ≤32x |
| Arena | 1,7 milyar post, 150M A [DOĞRULANDI, Ocak] | Turda 30M ARR; 29 Haziran 2026'da 100M ARR, tüketim fiyatlı | Turda 57x; bugün 17x |
| Prime Intellect | 1 milyar, 130M A, Radical lider [DOĞRULANDI, 8 Temmuz 2026] | 100M run-rate | ~10x |
| Applied Compute | 1,3 milyar post [DOĞRULANDI, Nisan]; 3 milyar görüşmesi Elad Gil [RAPOR, Ağustos]; 350M @ 3,25 milyar [RAPOR, Forbes 1 Eylül] | ~50M run-rate | 26x fiyatlı; 60-65x teklif |
| Mechanize | 500M post, 9,1M seed [DOĞRULANDI]; Google 1,5 milyar lisans ve işe alım görüşmesi [RAPOR, 6 Ağustos] | Gelir yok | 103 günde 3x step-up |
| Scale | ~29 milyar, Meta'dan beri donmuş | 2026 rehberi ~1 milyar, 2025 ~2 milyar | Küçülen gelirde ~29x |
Pazar neye ödüyor [GÖRÜŞ]: İşgücü pazar yerleri brütte 5-10x, nette 13-30x'te temizleniyor ve önemli olan net çarpan, çünkü Mercor'da brüt marj %27-33 ve emek gelirin üçte ikisi. Ortam-yerli ve eval işleri (Fleet, Arena, Prime Intellect, Applied Compute, Mechanize) yazılıma daha yakın gelirde 10-60x; Mechanize'ın 1,5 milyar görüşmesi ve Deeptune'un dört aylık flip'i, stratejik alıcıların run-rate'e değil ekip ve ortam IP'sine ödediğini gösteriyor. Dağılım şunu söylüyor: yatırımcılar marj yapısına ve lab tarafsızlığına ödüyor, take-rate işlerini BPO emsallerine doğru iskonto ediyor (Selina's Stack, 31 Aralık 2025: Mercor'un ~%35 take rate'i BPO'nun ~%34'üne sıkışır ve halka açık piyasada kazanç üzerinden işlem görür). Scale uyarıcı emsal: lab tarafsızlığı kaybı geliri bir yılda yarıya indirdi.
8.3 M&A
Mercor/Sepal (~6 Şubat 2026, YC S24, 20K+ uzman, bedel yok, Orrick). Mercor/Deeptune (9 Temmuz 2026; Foody: melek çeki "birçok açıdan ana motivasyon"; bedel yok; NYC ekibi Mercor'a). Anthropic/Vercept (25 Şubat 2026; Oren Etzioni ve bir kurucu katılmadı; bedel yok). Invisible/WeCP (10 Mart 2026; 2M teknik mülakat; Meridial'a katıldı). Handshake/Uplimit (30 Haziran 2026; AI Skills Studio). Google/Mechanize (6 Ağustos, 1,5 milyar+, münhasır olmayan lisans + ~35 personel; kapanmadı). Desen: hiçbir yerde açıklanmış fiyat yok; alıcılar konsolidatörler (Mercor) veya ekip alan lab'ler (Anthropic, Google). Tek müşterili ortam startup'ının çıkış yolu: o müşterinin acqui-hire'ı veya pazar yerine roll-up.
8.4 Şüpheci ve ayı görüşleri
- Lab'ler içeride kuruyor, satıcı kalitesi dengesiz. Nathan Lambert, "Notes from inside China's AI labs" (7 Mayıs 2026): Anthropic ve OpenAI "tek ortamlara 10M+, yılda kümülatif yüz milyonlar" harcıyor; Çin lab'leri "veri endüstrisini görece düşük kaliteli buldu ve ortamları içeride kurmak çoğu zaman daha iyi".
- Beceri öğrenilince değer sıfıra gider. Benjamin Anderson, "Don't build an RL environment startup" (7 Eylül 2025): model bir beceriyi öğrenince "o beceriyi öğreten veri seti ve ortamların değeri sıfıra eğilimli"; lab'ler klon başına "yüz binler, bazen milyonlar" ödüyor; açık kaynak hub'lar emtialaştırıyor. "Feature not a company" ve "melting ice cube" ifadeleri hiçbir 2026 kaynağında birebir bulunamadı; kayıtlı en yakın şüpheci Sherwin Wu.
- Kalabalık. Ben Lorica, Gradient Flow (14 Temmuz 2026): 25+ startup aynı iki problemde (pratik ortamları ve grader'lar); kazananlar RL'i lab olmayanlar için soyutlayanlar.
- Sentetik pipeline ~1 dolar/task. Fara-1.5, CUA-Gym (32.112 doğrulanmış RLVR tuple, 110 mock uygulama), Endless Terminals (3.255 görev "insan anotasyonu olmadan"), SWE-Universe, Terminal-World, SETA. Standard Intelligence'ın IDM'i aksiyon etiketi için anotatörü eliyor. Dürüst okuma: sentetik, verifier'ın programatik olduğu her yerde kazanıyor (terminal, kod, mock web); API'si olmayan uzman masaüstü yazılımı için gösterilmedi.
- Jeneralist ücret sıkışması, uzman ücret enflasyonu. Outlier jeneralist projeleri 2025 başında 28-35'ten Q1 2026'da 18-22'ye; DataAnnotation 15-25 ve "boş kuyruk" şikayetleri artıyor. Uzman ücretleri 85 (Luel) ile 150 (Foody) arası. Halter gerçek: jeneralist emek emtia, uzman emek açık artırmada.
- The Information, Mercor finansalları (22 Temmuz 2026): brüt marj 2025 %27, Q2 2026 %33, 2027 projeksiyonu %46; %91 lab; Meta hâlâ duraklatmış.
8.5 Hukuk ve düzenleme
- EU AI Act: GPAI yükümlülükleri (teknik dokümantasyon, Komisyon şablonunda kamuya açık eğitim verisi özeti, telif politikası) 2 Ağustos 2025'ten itibaren; mevcut modellere 2 Ağustos 2027'ye kadar süre. AI Office yaptırım yetkisi (15M euro veya küresel cironun %3'üne kadar) 2 Ağustos 2026'da başladı. Digital Omnibus (siyasi mutabakat 6 Mayıs 2026, yürürlük 27 Temmuz): Annex III yüksek risk 2 Aralık 2027'ye, Annex I 2 Ağustos 2028'e ertelendi; Madde 50(2) filigran 2 Aralık 2026'ya. İlgi: bir lab müşterisi, eğitim verisi özeti için satıcıdan kaynak ve lisans dokümantasyonu isteyecek.
- İşçi sınıflandırması: Cox v. Mercor.io ve OpenAI, Santa Barbara, 2 Ekim 2025 (yanlış sınıflandırma, kişisel makinelerde izleme yazılımı, ödenmemiş giderler; ihlal başına 25.000 dolara kadar ceza). Hall Attorneys toplu davası, N.D. Cal., 21 Nisan 2026, gözetim, biyometrik ve ihlal iddiaları ekliyor ve "büyük AI lab sanıkları" adlandırıyor. Surge: Cavalier v. Surge AI, Mayıs 2025. Scale: 12,5M uzlaşma, ön onay, Outlier ve Remotasks'i kapsıyor. Uzman sahipli makinelere kayıt yazılımı kuran bir masaüstü yakalama satıcısı doğrudan Cox olgu örüntüsünde oturur. Çözüm: şirket verilmiş veya sanallaştırılmış masaüstü, W-2 veya uyumlu EOR, gider geri ödemesi.
- Mercor LiteLLM ihlali: TeamPCP 27 Mart 2026'da PyPI'ye kötücül LiteLLM 1.82.7 ve 1.82.8 yayınladı (~40 dakika canlı); Mercor 31 Mart'ta doğruladı; ~4TB iddia, 40K+ kontratçı verisi; Meta süresiz durdurdu; beş kontratçı davası. Foody'nin karşı cümlesi: "her frontier lab ihlalden beri bizimle ilişkisini genişletti." Lab'ler artık satıcı tedarik zinciri güvenliğini kapı şartı olarak görüyor.
- GDPR: AEA dışından uzaktan erişim Bölüm V kapsamında aktarım; uzman ekran kayıtları ve ekrandaki her kişisel veri SCC veya eşdeğeri, DPIA ve minimizasyon gerektirir.
- Yazılım EULA'ları: Adobe s.17 (3 Ekim 2025'ten itibaren): kullanıcı yazılımı "veya ondan alınan ya da türetilen herhangi bir içerik, veri, çıktı veya bilgiyi" AI eğitmek için kullanamaz. Maxon 10.4 (Nisan 2026): yazılım veya çıktıları, "Yazılımdaki herhangi bir fonksiyona benzer bir fonksiyonu simüle eden veya yerine getiren" AI'ı eğitmek için kullanılamaz. Epic: Lisanslı Teknoloji "herhangi bir Üretken AI Programına eğitim girdisi" olamaz. Photoshop veya Cinema 4D kullanan uzmanı kaydedip computer-use modeli eğitmek en azından bir sözleşme sorusu, Maxon için tartışmasız doğrudan ihlal.
- Anthropic 1,5 milyar uzlaşması (nihai onay 20 Temmuz 2026): ~500K eser, eser başına ~3.000 dolar; eğitim fair use, korsan kopya indirme değil. Emsal değeri: köken, maruziyet başına kabaca 3.000 dolar fiyatlandı; temiz rıza ve temiz lisansla yakalama, ek yük değil para edilebilir özellik.
8.6 Sonraki dalga: 2026 sonunda ne fonlanabilir
- Computer-use aksiyon verisi. a16z, Sequoia/SI, Anthropic/Vercept. Fonlanabilir: API'si olmayan gerçek yazılım ve doğrulanabilir sonuçlar. Fonlanamaz: 1 dolar/trajectory pipeline'ın sentezleyebildiği tarayıcı görevleri.
- Gerçek yazılım ortamları. Fleet, Deeptune, Mechanize, Matrices, Halluminate. Çıta: sadakat + verifier + yenileme kadansı; Wing'in "ortam fabrikası" dediği, Prime Intellect Hub ve HUD'un emtialaştırmaya çalıştığı şey.
- Fiziksel AI verisi. H1 2026'da 47,4 milyar dolar; XDOF 70M (Thrive, Spark, a16z, Lux, 17 Haziran 2026); Config 27M; micro1 robotik. İnsan yakalamanın en az ikame edilebilir olduğu yer.
- On-prem ve kurumsal sahipli eğitim. Applied Compute (1,3 milyardan ~3,25 milyar görüşmesine), Prime Intellect ("her kurumsal, her ulus devlet"), Foody'nin "şirketler kendi zekâlarına sahip olur"u. Alıcı on lab'den binlerce kurumsala kayıyor; %91 lab yoğunlaşmasından tek kaçış.
- Doğrulama ve ödül modelleri. Gray Swan 40M A (Mayıs 2026, Wing ve Madrona), Patronus 50M B (25 Haziran), Vals AI 40M A (13 Ağustos, a16z), Arena 100M ARR. Grader'lar, a16z'nin "doğrulama" hendeğinin yaşadığı yer.
- Ortam fabrikaları ve roll-up'lar. Mercor'un beş ayda iki satın alması, Handshake, Invisible ve micro1 (hazır veride %80-90 marj): pazar yerleri ortamları kiralamak değil sahiplenmek istiyor.
8.7 Bir üst düzey VC'nin soracağı 15 en zor diligence sorusu (tek lab müşterili uzman masaüstü yakalama startup'ı için)
- Gelirin ne kadarı tek lab, fesih bildirim süresi ne? Geçer: minimum taahhütlü çok yıllı MSA ve ücretli pilotta ikinci lab. Kalır: 30 gün çıkışlı %91 tarzı yoğunlaşma.
- Müşterin MCI tarzı yakalamayla bunu kendisi kurabilir mi? Geçer: uzmanların lab'in yasal veya pratik olarak kadrolayamayacağı yazılımı kullanıyor (CAD, DAW, EHR). Kalır: külliyat tarayıcı ve üretkenlik uygulamaları.
- 1 dolar/trajectory sentetik pipeline seni neden değiştirmiyor? Geçer: görevlerin insansız programatik verifier'ı yok veya yazılımın headless modu yok. Kalır: ana görev kategorilerin CUA-Gym-Hub'ın 110 ortamıyla örtüşüyor.
- Standard Intelligence'ın inverse-dynamics etiketlemesi anotasyonunu gereksiz kılıyor mu? Geçer: niyet, rubric ve sonuç doğrulaması satıyorsun, aksiyon etiketi değil. Kalır: satış birimin etiketli tıklama.
- Bu yazılımı eğitim için kaydetme lisansın var mı? Geçer: yazılı carve-out veya ML kullanımına izin veren kurumsal lisans, ya da koşulları sessiz yazılım. Kalır: anlaşmasız Adobe veya Maxon oturumu yakalama.
- Kayıtların sahibi kim, uzman çalışan mı kontratçı mı? Geçer: şirket verilmiş veya sanallaştırılmış masaüstü, uyumlu istihdam, gider geri ödemesi. Kalır: Kaliforniya'daki 1099'ların kişisel laptop'larında kayıt ajanı.
- Veri nerede, uzmanlar nerede? Geçer: bölgeye sabitlenmiş depolama, SCC, dosyada DPIA, pipeline içinde PII redaksiyonu. Kalır: AB uzmanları ham ekran videosunu ABD bucket'ına yüklüyor.
- LiteLLM sonrası tedarik zinciri güvenlik duruşun ne? Geçer: SOC 2 Type II, SBOM, sabitlenmiş bağımlılıklar, müşteri başına veri izolasyonu, ihlal tatbikatı. Kalır: üçüncü taraf denetimi yok ve lab müşterileri arasında paylaşımlı altyapı.
- Verifier ne, ne sıklıkla kandırılıyor? Geçer: deterministik durum kontrolleri veya ölçülmüş inter-rater uyumlu uzman rubric'leri ve reward-hacking denetimleri. Kalır: sadece LLM-as-judge.
- Brüt ve net gelir, brüt marj ne? Geçer: uzman ödemeleri düşülmüş net, %50 üstü ve tekrar kullanımla yükselen marj. Kalır: tekrar kullanımsız geçiş ekonomisi.
- Yazılım yeni sürüm çıkarınca yenileme maliyeti ne? Geçer: otomatik yeniden kurma ve regresyon paketi, yenileme başına ölçülmüş maliyet. Kalır: elle yeniden kurulan klonlar.
- Model beceriyi öğrenince verinin değeri sıfıra mı gidiyor? Geçer: zorluğu model kapasitesini izleyen görev merdiveni ve lab'in ilk geçiş oranı sıçramasından sonra almaya devam ettiği kanıtı. Kalır: tek seferlik veri seti satışı.
- Aynı varlığı kurumsala satabilir misin? Geçer: kendi yığınında ortam veya eval için ödeyen en az bir lab-dışı müşteri. Kalır: sadece lab talebi.
- Lab'in AB eğitim verisi özeti ve Bartz tarzı dava için hangi kökeni verebilirsin? Geçer: kayıt başına rıza, lisans ve chain-of-custody, talep üzerine dışa aktarılabilir. Kalır: kontratçı onboarding'ine gömülü rıza.
- Lab içeri alırsa çıkış ne? Geçer: alıcının veri setinden bağımsız istediği ekip ve araç zinciri, ve ikinci lab ilişkisi. Kalır: değer tamamen tek müşterinin zaten elinde tuttuğu veri seti.
Kaynaklar: a16z, Sequoia Foody, Sequoia SI, Lightspeed Luel, NEA, Pavlov's List, TechCrunch Mercor 20B, Mercor finansalları, Arena 100M, Prime Intellect 130M, Applied Compute 3B, Selina's Stack Mercor, Lambert Çin lab'leri, Anderson, Lorica, Mayer Brown AI Act, Gibson Dunn Omnibus, Cox v. Mercor, Hall toplu dava, Scale uzlaşma, Mercor ihlali, Anthropic uzlaşma, XDOF.
Doğrudan okunan tezler:
- Wing VC, "Who will win the RL environment market" [GÖRÜŞ]: 2030'a kadar ~20 seed/A şirketi 3-5 lidere daralır, 1-2 platform öne çıkar. Alıcı lab'ler "düşünce ortağı" ister, satıcı değil. Scale emsali: 2019-2020'de ~5 AV müşterisinde %80+ gelir yoğunlaşması. Kazanan: replikasyon eğitimi altyapısı (deterministik reset/replay, ortam soyutlama, paralel orkestrasyon, kapalı döngü hibrit doğrulama), araştırma kimliği, önce lab sonra kurumsal, genişlik değil derinlik. 2030'da etiketlemedeki gibi ~3 adet 1 milyar+ ve 5+ adet 100M+ oyuncu.
- Wing VC, Ocak 2026 "training & verification layer by 2030" [GÖRÜŞ]: EDA benzetmesi; darboğaz model zekası değil, "AI'ın ürettiği işi ölçekli doğrulama". Ortam şirketleri "önce lab parasıyla kurulur". Coding ve computer-use ilk hendekler.
- Chemistry, "RL Reigns Supreme", 7 Temmuz 2025 [GÖRÜŞ]: kurumsal RL altyapısı; ortam kurucular listesi Mechanize, Matrices, Fleet, Habitat, Plato, Deeptune, Theta, Halluminate, HUD. Şüphe: reward hacking, ground truth olmayan görevler.
- Felicis, "Rocket Fuel for AI", 20 Ağustos 2025 [GÖRÜŞ]: iki katman, ortamlar ve RLaaS (Applied Compute, Veris, Osmosis). Doğrulanabilir ödül en güçlü coding ve matematikte; "evrensel doğrulayıcı" olmadan bulanık alanlar zor.
- Sapphire, 13 Nisan 2026 [GÖRÜŞ]: anlaşmalar çeyrek başına 6-7 haneli; basit klon on binlerce, karmaşık kurumsal araç birkaç yüz bin; task birkaç yüz ile birkaç bin dolar. Kazanan: mühendislik + alan derinliği + hızlı iterasyon.
- Epoch AI FAQ [RAPOR]: lab'ler kendi ortam ekiplerini kuruyor ("substantially more in-housing"), sebepler satıcı marjından kaçınmak, gizlilik, alan uzmanlığı. İnsan trajectory'leri çoğunlukla SFT "altın trajectory" olarak kullanılıyor, RL'de değil; geride kalan lab'lerde SFT karışımına atmak kolay. Vibe-coded bozuk web siteleri yüzünden "çok sayıda işe yaramaz kötü ortam" var. Pass rate hedefi %2-3 (64-128 denemede 1 başarı).
- SemiAnalysis [RAPOR]: Anthropic 12+ ortam şirketiyle çalışıyor, sandbox çerçevesine uyum şart, ekosistemi bilerek metalaştırıyor. OpenAI daha az satıcı, daha yüksek toplam harcama, "yüzlerce UI gym" aldı, insan verisi ekibini içeride kuruyor. GDM merkezi değil, kendi uygulamalarını kullanıyor. Çoğu ortam startup'ı seed, 20 kişi altı, 1-3 müşteriye münhasır.
- Şüpheciler: Sherwin Wu (OpenAI API mühendislik başkanı), TechCrunch 16-21 Eylül 2025: "RL ortam startup'larında short'um", rekabet yoğun ve araştırma çok hızlı. Karpathy: "ortamlara ve ajan etkileşimlerine boğayım ama RL'e özel olarak ayıyım." Ross Taylor (General Reasoning): reward hacking, ölçekleme zorluğu hafife alınıyor. future-stack-reviews: "henüz tek bir satın alınabilir ürün yok"; altı tedarik katmanının sadece ikisi (sandbox, arayüz) standartlaşıyor; dünya yaratma, task ve ödül tanımı, eğitim operasyonu, üretim sadakati parçalı.
- Sermaye penceresi: 25 Haziran - 9 Temmuz 2026 arasında büyük hareketler; Prime Intellect Series A 130M, 1 milyar değerleme. [RAPOR]
- Emtia fiyatı: Prime Intellect bounty'leri 100-500 dolar (giriş), 1.000-5.000+ (uygulama ile). İki ayda 400+ ortam. Bu, "basit ortamın" fiyatı.
9. Vagon ve PixelNode dış görünümü (şüpheci VC'nin göreceği şekliyle)
Bu bölüm yalnızca kamuya açık kaynaklardan derlendi. İçeriden bildiğin gerçekler farklıysa, önemli olan şu: VC de bunları görecek ve düzeltmeni bekleyecek. Erişilemeyen sayfalar: Crunchbase, Dealroom, PitchBook, ekşi sözlük, G2, LinkedIn/pixelnode-ai, github.com/pixelnode-ai, pixelnode.ai/about (prod), pixelnode.ai/security, x.com/vagonHQ.
9.1 Vagon
- Kuruluş: 2019, Zahid Sağıroğlu (CEO), Hasan Can Yaşar, Serdar Demireren; İstanbul kökenli; açık beta ve Product Hunt 19 Mart 2020 [RAPOR, Webrazzi]. LinkedIn HQ San Francisco, 11-50 çalışan, 42 kişi, 2.705 takipçi [DOĞRULANDI]. Dört açık rolün hepsi İstanbul hibrit (DevOps, Full Stack, Account Manager, Marketing Growth Intern); AI/ML/veri rolü yok. SF adresi kağıt üstü, mühendislik İstanbul'da [GÖRÜŞ].
- Yatırım: tek açıklanmış tur: 4M TL (~508K dolar) pre-Series A, 4 Mayıs 2021, APY Ventures, Bilişim Vadisi GSYF, Eren Bali, Sina Afra, Mustafa Küçük. CB Insights: toplam 550K, STING de yatırımcı. 2022-2026'da Series A bulunamadı. 2021 haberi 8 lokasyonda 25.000 kullanıcı ve "yıl içinde Series A" diyordu; gerçekleşmedi.
- Ürünler [DOĞRULANDI, 5 Eylül 2026]: Cloud Computer (4K/60fps, "Vagon Interactive Streaming Protocol", "23+ veri merkezi", NVIDIA ortağı). Teams (DaaS; PH 27 Şubat 2025, 26 upvote). Teams dokümanlarında admin kontrollü Session Recording (.mp4, girdi ve kayıt senkronu için SYNC ON/OFF olayları) ve Input Recording (zaman damgalı fare/klavye, "gelecek değerlendirme için" tekrar oynatılabilir). Rıza dili yok, AI/veri seti dili yok. PixelNode'un üzerine kurulduğu yakalama primitifi bu. Streams (Unreal/Unity pixel streaming, "20+ bölge"). Virtual (vCore hipervizör + vDesk VDI; "VMware ve Citrix'e modern alternatif"; 14 dolar/çekirdek). Virtual sayfasında doldurulmamış sayaçlar ("0K+ Users", "0.00% Uptime", "0M+ VDIs") ve "Dennis Singh, VP IT, Continental Bank Group" adlı doğrulanamayan bir referans var. Taslak veya şablon sayfa gibi okunuyor; pazarlama hijyeni açısından diligence kırmızı bayrağı [GÖRÜŞ].
- Fiyat [DOĞRULANDI]: dakika bazlı. A10G katmanı: Spark 4c/16GB 1,67 dolar/saat, Flame 8c 2,27, Blaze 16c 3,57, Lava 4xA10G 11,97. T4: Planet 4c 0,99, Star 16c 2,99, Galaxy 4xT4 8,99. CPU 0,25-4,59. Depolama 7,99/ay (75GB), Premium 19,99, ek 50GB 5 dolar, 10GB sonrası egress 1,50/10GB. Teams 3,99-96,74 dolar/bilgisayar/ay, 40 saat tavanlı. Streams T4 0,025/dk (1,50/saat), A10G 0,036/dk (2,16/saat), L4 0,036/dk. AWS Marketplace'te 20/100/500 dolar kredi SKU'ları.
- Uygulamalar: Blender, Photoshop, Cinema 4D, Houdini, ZBrush, Revit, Premiere, Unity, Unreal, VS Code, Autodesk, Adobe.
- "250K+ profesyonel" sadece PixelNode sayfalarında (careers: "250K+ profesyonelin günlük işini çalıştırdığı bulut bilgisayar platformu"; about: "2024: Vagon 250K+ profesyonele büyüdü"). vagon.io'da bugün çekilen hiçbir sayfada yok; bağımsız arama sonuç vermedi. Mayıs 2021'de 25K'dan, 1M dolar altı yatırım ve 42 kişiyle üç yılda 250K'ya: kayıtlı hesap için mümkün, günlük aktif için inandırıcı değil. Kanıtlanana kadar kümülatif kayıt sayılır [GÖRÜŞ]. Veri merkezi: 8 (2021), "20+" (Streams), "23+" (ana sayfa).
- Yorumlar: Trustpilot 4,1/5, 99 yorum, %59 beş yıldız, %20 bir yıldız. Tekrar eden şikayetler: 5-10 dakikalık açılış ve kapanışın spin-up'tan itibaren faturalanması ("bağlantı timeout'ları gerçek kullanım maliyetine %25 ekliyor"), abonelik + kredi çift ücretlendirme, "mükemmel bağlantıda bile" lag (Ağustos 2026), yanıtsız iade talepleri, olumsuzların sadece %33'üne ve genelde bir ay sonra yanıt. Product Hunt 3,3/5, 3 yorum, biri "son derece güvenilmez". Capterra Teams 5,0/5, 3 yorum, son Ağustos 2024. ekşi sözlük başlığı var: donanım zayıfken render için faydalı, internete çok bağımlı, sürekli kullanımda pahalı. Reddit'te iki aramada hiçbir başlık yok.
- Basın ve AI konumlanması: kapsam 2020-2021 (Webrazzi, egirişim, Archinect, BlenderNation, SolidSmack, Parametric Architecture) + Ağustos 2024 Unity iş birliği. 2025-2026'da Product Hunt ve kurucu paylaşımları dışında hiçbir şey. Vagon'un hiçbir mülkünde OpenAI, herhangi bir lab, ajan veya eğitim verisi geçmiyor. Blog (Eylül 2026) tamamen yaratıcı araç eğitimleri ve VDI/Citrix karşılaştırma SEO'su.
9.2 PixelNode.AI
- Siteler ne iddia ediyor [DOĞRULANDI, 5 Eylül 2026]: "Where AI learns to work." Üç suit: Capture (ekran, girdi, ses, dosya, makine durumu; pencere hariç tutma "privacy mode"; think-aloud; tablet ve çift monitör), Environments (gerçek bilgisayarlar sıfırlanabilir, doğrulanabilir RL ortamı olarak; "gerçek bir uzman oturumunun 47. dakikasını dondur ve ajanların bin kez kurtarma pratiği yapmasına izin ver"), On-Prem Fine-Tuning ("EGRESS 0 BYTES"). arXiv 2505.13909 ve "312 artırılmış insan trajectory'si %141 göreli iyileşme" istatistiği. Hedef kitleler: frontier lab'ler, yetenek platformları (white-label capture), kurumsallar. Durum: "Private beta, now onboarding design partners"; AI Labs ve Enterprise parkurları "Coming soon". CTA: Book a demo, Request beta access. hello@pixelnode.ai, "© 2026 PixelNode, Inc." Footer'da X, LinkedIn, GitHub, Careers, Security linkleri.
- Önizleme build'i daha sert sayılar veriyor: 214+ golden image, 18 bölgede 1.024 aktif ortam, 1,8 saniye restore vs tipik VM'de 4-6 dakika, ISO 27001, SOC 2, GDPR. Bunlar prod'da çıkmadı. 1.024 ortam hepsi çalışsa bölge başına ~45 A10G eşdeğeri demek; uyum rozetleri /security 404 verdiği için doğrulanamıyor. Denetçi mektubu çıkana kadar hedef sayılır [GÖRÜŞ].
- Ekip ve tarih: Careers'ta dört uzaktan "founding-team scope" rol (RL Environments Engineer, Capture Systems Engineer, Founding Product Designer, ML Data Operations Lead) + dokuz meslekte oturum başı ödemeli "Expert Network" (3D, oyun, CAD, ses, VFX, mimarlık, muhasebe, fotoğraf). "Vagon üzerine kuran küçük bir ekip." About zaman çizelgesi: 2019 Vagon, 2024 250K+, 2025 PixelNode kuluçka, 2026 "Capture ve Environment suitleri frontier lab'lerle özel betaya girdi"; kurucu adı yok, yatırımcı yok. dev.to'daki "Berk from Vagon" (Şubat 2025) ve workers.dev alt alan adı "berkboz" aynı kişi.
- Dış ayak izi: Product Hunt lansmanı yok, basın yok, GitHub org'u yok (404), LinkedIn şirket sayfası yok (404), X paylaşımı yok, Crunchbase kaydı yok. "Frontier lab'lerle özel beta" iddiası lab tarafından veya üçüncü taraftan hiçbir kaynakla desteklenmiyor [GÖRÜŞ].
- Freelancer tartışması: Vagon veya PixelNode "recorded session" işleri için Upwork, Bionluk, Reddit ve Türk forumlarında hiçbir şey çıkmadı. Ortaya çıkan şey uzman arzı için rekabet: Mercor Mart 2026'da Blender'ı listeleyen anlatımlı ekran kaydı işleri açtı; "AI eğiterek para kazan" derlemeleri 17-33 platform sayıyor. PixelNode'un kamu algısı esasen sıfır; Vagon'un algısı "çalışınca çalışıyor, pahalı, yavaş açılıyor, destek zayıf" [GÖRÜŞ].
9.3 Bulut iş istasyonu satıcıları: kim ajana döndü
- Amazon WorkSpaces for agents: önizleme 5 Mayıs, GA 1 Temmuz 2026; MCP araç yönlendirme, gerçek zamanlı oturum kontrolü, domain'e bağlı filolar, "denetim ve hata ayıklama için" ekran görüntüsü depolama; saniye bazlı fatura, bölge başına ayda 10 ücretsiz saat, Windows için 6,42 dolar/kullanıcı/ay; 13 bölge. Ajan çalıştırma için, insan yakalama için değil.
- Windows 365 for Agents: 22 Ocak 2026 duyuru; ajanlara Entra ID; 0,40 dolar/saat on-demand veya 5 dolar/ay + kullanım; Build'de (2 Haziran 2026) genişletildi, Agent 365 GA 1 Mayıs 2026. Eğitim verisi dili yok.
- Shadow (OVH kurucusu): VivaTech 15 Haziran 2026'da boş gündüz oyun kapasitesiyle "GPU Cloud & Inference"; ajan eğitimi veya ortam satışı yok. Paperspace/DigitalOcean: "agentic inference cloud", AMD MI350X (19 Şubat 2026); çıkarım, yakalama değil. Kasm: "Secure AI Environments" sayfası. Parsec/Unity, Neverinstall, Juno, Cudo, Omniverse Cloud, MacStadium, Scaleway Mac, Frame/Dizzion, Google Cloud Workstations, Lambda, CoreWeave: 2026'da lab'e ortam veya yakalanmış oturum sattığına dair kanıt yok.
- Net: hyperscaler'lar "ajanlar için masaüstü"ne sahip; fonlu startup'lar "lab'ler için ortam"a; kimse kamuya açık olarak "gerçek profesyonelleri gerçek yazılımın içinde ölçekli yakala"ya sahip değil. Bu boşluk PixelNode'un tezi ve gerçek, ama boş olmasının sebebi lab'lerin yakalama aracını satın almak yerine sahiplenmeyi tercih etmesi olabilir (Mercor'un kendi yakalama aracı) [GÖRÜŞ].
9.4 GPU bulut masaüstü birim ekonomisi
| Instance | GPU | vCPU/RAM | dolar/saat |
|---|---|---|---|
| AWS g4dn.xlarge (Linux) | T4 16GB | 4/16 | 0,526 (spot 0,318) |
| AWS g5.xlarge (Linux) | A10G 24GB | 4/16 | 1,006 (spot 0,624) |
| AWS g6.xlarge (Linux) | L4 24GB | 4/16 | 0,805 (spot 0,720) |
| Azure NV6ads_A10_v5 | 1/6 A10 | 6/55 | 0,454 Linux, 0,73 Windows |
| GCP g2-standard-4 | L4 | 4/16 | 0,707 |
| Lambda | A10 24GB | 1,29 | |
| Paperspace | RTX4000 / A4000 / A5000 | 0,56 / 0,76 / 1,38 | |
| Windows 365 for Agents | GPU yok | 0,40 |
Vagon'un Spark/Planet/Streams-L4 katmanları tam olarak g5.xlarge/g4dn.xlarge/g6.xlarge spec'lerine eşleniyor ve A10G AWS'ye özel SKU; Vagon neredeyse kesin EC2 yeniden satıyor [GÖRÜŞ]. Sadece compute üzerinden ima edilen brüt marj: Planet 0,99 vs g4dn 0,526 Linux ~%47 (Windows'ta ~%28, spot'ta ~%68); Spark 1,67 vs g5 1,006 ~%40 (spot ~%63); Streams L4 2,16 vs g6 0,805 ~%63; Streams T4 ~%65 (multitenancy daha yukarı iter). Depolama 7,99/75GB vs gp3 ~6: başabaş, tutma ücreti. Windows lisansı, önceden pişirilmiş imajlar için EBS, egress (Vagon 0,15/GB, AWS ~0,09), sıcak havuz boşta süresi ve kullanıcıya faturalanan 5-10 dakikalık açılış düşülünce Cloud Computer'da gerçek marj %30-45, Streams'te %50-60, destek ve ödeme ücretleri öncesi. Varsayılan 1,2-3M ARR'de (42 kişi İstanbul, Series A yok, altı yılda 99 Trustpilot yorumu) iş, donanımı olmayan ve kayda değer hacim indirimi olmayan ince bir bayi [GÖRÜŞ]. PixelNode için aynı yığında ortam-saati ham maliyeti 0,53-1,01 dolar; GPU'suz Windows 365 ajan PC'si 0,40. GPU yalnızca hedef uygulama (Blender, Premiere, SolidWorks) gerektirdiğinde savunulabilir.
9.5 Türkiye
Türk AI startup haritası: 457 (Ocak 2026) → 482 (Nisan 2026); yeni startup'ların üçte biri "agentic"; Q1 2026 yatırım 559M dolar, önceki yılın yedi katı. Hükümet: 2026-2030 AI Eylem Planı, 2026'da veri merkezi ve AI'a 3 milyar dolar, Haziran 2026'da 10.000 ileri AI uzmanı yetiştirme taahhüdü; TÜBİTAK "Bilge" LLM; Turkcell-Google Cloud Ankara hyperscale DC 2028; Ulusal Veri Sözlüğü; HIT-30. Veri/anotasyon: DOĞAKA Kahramanmaraş "AI sözel veri etiketleme merkezi" fizibilitesi; Co-one (Türk kurucular, Tallinn kayıtlı, 7,03M). PixelNode dışında Türk RL ortamı veya computer-use veri startup'ı bulunamadı. Vagon Türk basını: Webrazzi Mart 2020 ve Mayıs 2021, egirişim Mayıs 2021; 2022-2026 hiçbir şey.
9.6 Şüpheci VC'nin yazacağı güçlü ve zayıf yanlar
Güçlü:
- Gerçek, çalışan yakalama primitifleri: senkron işaretli admin kontrollü oturum ve girdi kaydı Vagon Teams dokümanlarında zaten var; PixelNode sıfırdan başlamıyor.
- Lab'lerin simüle edemediği uygulamalarda (Blender, Houdini, Revit, Premiere, SolidWorks) GPU kullanan profesyonellerden oluşan dağıtım hunisi, 20+ bölgede önceden pişirilmiş golden image.
- Altı yıllık streaming protokolü ve imaj yönetimi deneyimi; düşük yakışlı İstanbul ekibi; dakika bazlı fatura ve uygulama kataloglarını RL-env startup'ları hızlı kopyalayamaz.
- Bir boşluk: hiçbir hyperscaler veya fonlu env startup'ı kamuya açık olarak "gerçek masaüstü yazılımının içinde gerçek uzman yakala" satmıyor.
Zayıf:
- "250K" sayısı doğrulanmamış ve sadece PixelNode sayfalarında. 1M dolar altı yatırımla 2021 rakamının 10 katı. MAU, ödeyen kullanıcı ve aylık stream edilen saat istenecek.
- Sermaye yok, traction sinyali yok. 550K toplam yatırım, 2021'den beri tur yok, altı yılda 99 Trustpilot yorumu, PH lansmanları 119'dan 26 upvote'a düşüyor. Vagon büyüyebildiğini kanıtlamadı; PixelNode bunu miras alıyor.
- İnce bayi ekonomisi. GPU dizisi EC2 g4dn/g5/g6, gerçekleşen marj %30-45, AWS fiyat hareketlerine ve CPU-only ajan işi için 0,40 dolar/saatlik Windows 365'e maruz.
- Rıza ve veri hakları. Vagon dokümanlarında kayıt için rıza akışı yok; tüketici bulut PC tabanını eğitim verisine dönüştürmek GDPR/KVKK ve lab tedarik sorunları çıkarır. "Oturum başı ödemeli" uzman ağı yeni bir maliyet kalemi, bedava varlık değil.
- Uzman arzı için rekabet. Mercor ve 30+ platform zaten Blender uzmanlarına anlatımlı oturum kaydettiriyor, kendi yakalama araçlarıyla; lab'lerin üçüncü tarafın masaüstüne ihtiyacı olmayabilir.
- Ürün hijyeni. Vagon Virtual sıfırlanmış sayaçlar ve doğrulanamayan banka referansıyla yayında; PixelNode önizleme build'i /security 404 verirken ISO 27001/SOC 2 iddia ediyor. Lab tedarik ekipleri fark eder.
- Güvenilirlik itibarı. %20 bir yıldız, 5-10 dakikalık açılış, iyi bağlantıda lag, bir ay süren destek sessizliği. Kullanıcıların on dakikada bağlandığını söylediği bir platformda "1,8 saniyede restore" satan RL ortam satıcısının kapatması gereken bir kredibilite açığı var.
- Hyperscaler sıkıştırması. AWS ve Microsoft artık kimlik, denetim ve MCP ile ajan masaüstü satıyor; lab'ler ortam için onlarda standartlaşırsa PixelNode'un farkı yakalama UX'i ve uzman tedarikine, yani hizmet işine iner.
- Lab tezinin sıfır dış doğrulaması. "Frontier lab'lerle özel beta"nın lab tarafında, basında, GitHub, LinkedIn veya X'te ayak izi yok. Herhangi bir term sheet öncesi tasarım ortağı listesi ve imzalı pilot şartları istenir.
Kaynaklar: Webrazzi 2020, egirişim 2021, APY portföy, CB Insights Vagon, Vagon LinkedIn, Vagon careers, Vagon pricing, Vagon Virtual, Teams session recording, Teams input recording, Trustpilot, Product Hunt, pixelnode.ai, PixelNode careers, PixelNode about, Önizleme build, AWS WorkSpaces for agents, Windows 365 for Agents, Shadow VivaTech, Vantage g5, Vantage g4dn, Vantage g6, Fintechtime TR AI, SETA 2026 AI.
10. Açık veri setleri, benchmark'lar ve format spec'i
10.1 Veri seti envanteri
| Veri seti | Boyut | Uygulama / OS | Kaydedilen | Toplama | Lisans, HF indirme/ay | Eğitim sonucu |
|---|---|---|---|---|---|---|
| AgentNet (xlang-ai, OpenCUA, Ağustos 2025) | 22.625 görev, ort. 18,6 adım; 200 GB | 12K Windows / 5K macOS / 5K Ubuntu; 140+ uygulama, 190 site | Ekran videosu, fare+klavye sinyalleri, erişilebilirlik ağacı; keyframe + aksiyon + yansıtıcı CoT "düşünce"ye işlenmiş | AgentNetTool anotatörlerin kendi PC'lerinde; kitle platformları + anotasyon şirketleri | MIT; 2.831 | OpenCUA-72B OSWorld-Verified %45,0; Ubuntu 3K→10K = +%72, Win/Mac 3K→14K = +%125 |
| PC-Agent-E (GAIR, Mayıs 2025, ICLR 2026) | 312 insan trajectory'si; HF'de 4.503 satır | Windows | Ekran görüntüsü, tıklama koordinatı, tuş, model tamamlamalı insan "düşüncesi" | PC Tracker; Claude 3.7 ile Trajectory Boost | MIT; 163 | WAA-V2'de +%141 göreli |
| ANCHOR (Yale NLP, Şubat 2026) | 168 tohum → 1.777 başarılı trajectory, 30K görüntü | Ubuntu + Windows | Ekran görüntüsü + aksiyon; anlamlı durum değişimlerinde dallanma | Yürütücü Claude Sonnet 4.5, öneri/doğrulama GPT-5.1; başarılı trajectory başına 0,47 dolar; verifier %87 doğru | Qwen3-VL-8B: OSWorld 16,8→20,6; WAA 23,1→30,8 | |
| VideoCUA / CUA-Suite (ServiceNow + Mila/McGill/Oxford, Mart 2026) | ~10K görev, 87 uygulama, 55 saat, 6M kare 30 fps | Profesyonel masaüstü uygulamaları | Kesintisiz video, milisaniye imleç kinematiği, tuşlar, çok katmanlı akıl yürütme anotasyonu (adım başına ort. 497 kelime) | ~70 saatlik ücretli anotatör (Hindistan, LatAm, teknik derece), görev başına 60-90 dk QA dahil | CC BY 4.0 / MIT; 1.162 | OpenCUA-32B %37,7 @50px vs insan %57,6 |
| markov-ai/computer-use-large (Mart 2026) | 48.478 video, ~12.300 saat, 856 GB | AutoCAD 2.149 saat, Blender 3.624, Excel 2.002, Photoshop 2.060, Salesforce 2.336, VS Code 127 | Sadece ekran videosu; ses silinmiş, olay yok, aksiyon yok | "İnternetten toplandı" | CC BY 4.0; 12.157 | Yok |
| markov-ai/computer-use | 160 başarılı trajectory, 1.378 adım | OSWorld VM'leri | Ekran görüntüsü, pyautogui, a11y ağacı, MP4 | Ajan rollout'ları | Apache 2.0; 583 | Yok |
| GUI-360 (Microsoft, Kasım 2025) | 1,2M+ yürütülmüş aksiyon adımı | Windows ofis uygulamaları | Tam çözünürlük, a11y, akıl yürütme, başarılı ve başarısız trajectory'ler | Büyük ölçüde otomatik LLM pipeline | HF | Benchmark |
| AndroidControl (Google, Haziran 2024) | 15.283 demo, 833 uygulama | Android | Ekran, a11y, aksiyon | İnsan | CC0 | Alan içi ölçekleniyor; alan dışı "belirgin biçimde daha yavaş ölçekleniyor" |
| GUI-Odyssey (OpenGVLab) | 8.334 bölüm, 212 uygulama | Android çapraz uygulama | Ekran, aksiyon, adım başı akıl yürütme | İnsan | CC BY 4.0; 12.944 | |
| OS-Genesis (ACL 2025) | ~1K trajectory/alan | AndroidWorld, WebArena | Ters sentezlenmiş görev, TRM ödülü | GPT-4o keşfi | MIT | İnsan verisi performansının %80+'ını koruyor |
| DatoricAI/computer-use-agent-traces-250k (ticari önizleme) | İddia 250K iz, ~15.000 saat | Tarayıcı ağırlıklı | Ekran, DOM, aksiyon, sonuç etiketi | "Gerçek dünya", rıza belgeli | Ticari; 25 | Yok |
Çıkarım: açık, insan, masaüstü ve olay seviyesinde sadece AgentNet, VideoCUA ve PC-Agent-E var. Hiçbir açık veri seti insan operatörün sesli anlatımını içermiyor; VideoCUA'nın "akıl yürütme anotasyonları" anotatörlerin sonradan yazdığı metin, PC-Agent-E'nin düşünceleri model tamamlamalı. İndirme sıralaması: benchmark'lar ve bedava toplu video ayda 10K+; olay seviyesindeki tek iki açık insan masaüstü seti (AgentNet, VideoCUA) ayda 1-3K.
10.2 Kalite vs miktar: kanıtlar
| Bulgu | Sayı | Kaynak |
|---|---|---|
| Küçük uzman seti ölçeği yeniyor | 312 trajectory + sentetik dallanma: WAA-V2'de +%141 | PC Agent-E |
| Ölçek dağılım içinde hâlâ ödüyor | AgentNet Ubuntu 3K→10K +%72 | OpenCUA |
| Tek başına ölçek alan dışında başarısız | AndroidControl OOD yavaş | |
| Dallanma noktası genişletme | 168 tohum → 1.777, 0,47 dolar/trajectory | ANCHOR |
| Çoğunlukla otomatik karışım | Fara-1.5: %60 canlı web, %12,8 sentetik, %85,3 FaraGen; ~1 dolar/task; üç verifier (doğruluk, verimlilik 1-5, kritik nokta uyumu) | Fara-1.5 |
| Doğrulanmış sentetik RL tuple'ları | 32.112 RLVR tuple, 110 ortam (O*NET ve Anthropic Economic Index'e göre seçilmiş 16 masaüstü + 94 mock web); OSWorld-Verified %62,1/72,6 | CUA-Gym |
| Prosedürel terminal | 3.255 görev; dağılım içi 10,7→53,3 ama Terminal-Bench 2.0'da sadece 2,2→3,4 | Endless Terminals |
| Güvenilirlik bir veri özelliği | OSWorld tekrarlarında başarı stokastik; tekrarlı koşu ve açıklama isteme | 2604.17849 |
| Kurtarma verisi | BackBench: 50 zarar-kurtarma görevi, 1.130 ikili insan yargısı | 2604.18847 |
| Checkpoint fork altyapısı | Crab: eBPF ile checkpoint/restore, kurtarma doğruluğu %8→%100, %87 az checkpoint trafiği; sadece konteyner/microVM | 2604.28138 |
Okuma: lab'ler "az sayıda doğrulanmış insan tohumu, sonra çalıştırılabilir verifier ile makine genişletmesi"nde birleşti. Hiçbir açık veri setinin kapsamadığı adım: insan kurtarma dalı. Profesyonel uygulamada hata durumuna giren gerçek bir uzmanın oradan çıkması, aynı checkpoint'ten fork olarak kaydedilmiş. ANCHOR durum değişiminde fork ediyor ama takipçi LLM; BackBench 50 görev ve model üretimi planlarla. Destedeki "47. dakikayı dondur" tam bu boşluğu dolduruyor ve akademik olarak da bugün kimse yapmıyor.
10.3 Lab'lerin gerçekten yuttuğu formatlar ve standartlar
Trajectory formatları: ekran görüntüsü + aksiyon JSON(L) + opsiyonel düşünce alanı (AgentNet, PC-Agent-E, ANCHOR, OS-Genesis); video + olay logu (VideoCUA: MP4 1920x1080 30 fps + action_log.json; CutVerse: yüksek kare hızlı kayıt + I/O logu); erişilebilirlik ağacı (AgentNet ham, GUI-360, AndroidControl, WebChain DOM).
| Çerçeve | Sözleşme | Kaynak |
|---|---|---|
| OpenEnv (Meta/HF) | Gymnasium tarzı reset(), step(action), state(); Docker + HTTP/WebSocket; HF Spaces'e dağıtım; BSD-3; 2,5K yıldız | github.com/meta-pytorch/OpenEnv |
| verifiers (Prime Intellect) | Ortam sınıfları + rubric ödül fonksiyonları; Environments Hub; MIT; 4,6K yıldız | |
| Harbor (Laude) | Görev dizini: task.toml, instruction.md, environment/Dockerfile, solution/solve.sh, tests/test.sh; verifier /logs/verifier/reward.json yazar; Terminal-Bench 2.0 resmi harness'ı; Apache-2.0; 5,0K yıldız | harborframework.com |
| HUD SDK | Protokol öncelikli: manifest, task start, graded reward; SSH, MCP, CDP, RFB (VNC computer use), robot; Harbor uyumlu; MIT | |
| Cua | macOS/Windows/Linux/Android sürücüleri, CLI ve MCP sunucusu; birleşik screenshot/click/type API; Lume VM; MIT; 22,2K yıldız | |
| CUA-Gym-Hub | Mock uygulama başına durum inceleme ve reset için birleşik HTTP API, durum enjeksiyonu, paralel RL worker'lar için oturum izolasyonu | |
| OSWorld-V2 | Docker (KVM) ve AWS için Ubuntu VM imajları; göreve özel evaluator'lar; kapılı HF görev seti xlangai/osworld_v2_tasks; sürüm osworld-v2-2026.08.08 | |
| Anthropic sandbox-runtime | OS seviyesinde FS/ağ izolasyonu (Seatbelt, bubblewrap, WFP); terminal süreçleri ve MCP sunucuları, GUI değil |
Bir "Result Verifier API"nin uyması gerekenler (Eylül 2026 birleşimi): task id + son ortam anlık görüntüsünü (dosyalar, uygulama proje durumu, ekran) kabul et; önce deterministik kod çalıştır (Harbor tests/, CUA-Gym reward.py, DeskCraft proje dosyası parse eden "alan farkındalıklı verifier"lar); VLM yargıcına sadece yayınlanmış insan uyumuyla düş (CutVerse GPT-5.4 ile %98,3, Claude Opus 4.6 ile %99); [0,1] skaler + metrik sözlüğü döndür; kısmi kredi (OSWorld 2.0) ve tekrarlı koşu toplaması destekle.
Bir "Agent Gateway reset/step/observe"un uyması gerekenler: reset(task_id, seed_state) gözlem döndürür; step(action) Cua/OSWorld/pyautogui primitif seti (click, drag, type, key, scroll) + done; observe() doğal çözünürlükte ekran, opsiyonel a11y ağacı ve durum hash'i; checkpoint() ve fork(checkpoint_id) dallanma verisi için (ANCHOR, Crab); Claude/OpenAI/Gemini harness'ları adaptörsüz bağlansın diye MCP araç sunumu (HUD, Cua); HF Space olarak yayınlanabilsin diye OpenEnv uyumlu HTTP/WebSocket sarmalayıcı.
10.4 2026 benchmark'ları ve yaratıcı/mühendislik boşluğu
| Benchmark | Sürdüren | Ölçek | Yaratıcı/mühendislik uygulamaları | En iyi |
|---|---|---|---|---|
| OSWorld-Verified | xlang-ai (HKU) | 369 görev; insan %72,36 | GIMP, VLC, LibreOffice, VS Code | %85-86 frontier |
| OSWorld 2.0 | xlang-ai, 68 yazar | 108 iş akışı; Creative Production + Research %40+ | Tam uygulama listesi HF'de kapılı; FreeCAD, Shotcut, REAPER, MuseScore, Zotero dışarıdan alıntılamadan önce xlangai/osworld_v2_tasks ile doğrulanmalı | Opus 4.8 %20,6 binary |
| CutVerse (Mayıs 2026) | CUC, NUS | 186 görev, 2,43 saat uzman kaydı, 3.484 atomik etkileşim, Windows 11 Hyper-V | Premiere Pro, After Effects, Photoshop, DaVinci Resolve, JianYing, ComfyUI, Keling | Opus 4.6 %68,3, Gemini 3 Flash %67,2 (manşet %36 UI-TARS-1.5-7B) |
| DeskCraft (Haziran 2026) | ZJU, Tsinghua, Tencent, HKU | 538 görev | GIMP, Inkscape, Kdenlive, Audacity, Blender + ofis | Kimi-K2.6 %33,8 |
| Cua-Bench KiCad (Haziran 2026) | Snorkel + Cua | 25 görev, ~50 insan adımı | KiCad | Fable 5 ve GPT-5.5 6/25; sıfırdan 0/16 |
| SheetBench-50 (Ekim 2025) | HUD + Sepal | 50 finans tablosu görevi | Sheets/Excel | |
| ScreenSpot-Pro (Nisan 2025) | NUS | 1.581 talimat, 23 uygulama, hedefler ekranın %0,07'si | Photoshop, Premiere, Illustrator, Blender, FL Studio, Unreal, DaVinci, AutoCAD, SolidWorks, Inventor, Vivado, MATLAB | %18,9 çıkışta; 13.082 HF indirme/ay |
| GDPval | OpenAI | 1.320 görev, 220 açık | Teslimat puanlı, GUI izli değil |
Boşluk: yukarıdaki her yaratıcı/mühendislik benchmark'ı ya sadece açık kaynak uygulama (DeskCraft, OSWorld), ya Windows Adobe lisanslı Çin üniversitesi (CutVerse), ya 25 görev (KiCad). Hiçbiri eğitim seti göndermiyor. Fusion 360, SolidWorks, Revit, Ableton, Pro Tools, Cinema 4D, Houdini, Unreal veya Substance için ScreenSpot-Pro'nun tek ekran görüntülü grounding'i dışında açık benchmark yok.
10.5 Fiyat sinyalleri
Sentetik masaüstü trajectory 0,47 dolar (ANCHOR). İnsan web demosu ~1 dolar (Fara). VideoCUA insan maliyeti: görev başına 60-90 dk saatlik ücret, Hindistan/LatAm. Uzman pazar yeri: Mercor ortalama ~114 dolar/saat (Ağustos 2026), 60-250 aralık, ~%35 take; uzmanlar 130-180. Tam yüklü uzman masaüstü saati: QA öncesi kabaca 150-300 dolar/kayıt-saati [türetilmiş]. Markov: "10.000+ saat", "150K+ indirme", CAD kapsamı, senkron olay + anlatım, altın çıktı + rubric; kamuya açık fiyat yok. Datoric: ticari lisans, özel/münhasır koleksiyon, fiyat yok.
10.6 Spec: 2026'da bir lab araştırmacısının "altın standart" diyeceği uzman masaüstü trajectory seti
- Operatörler: hedef uygulamada 5+ yıl kredili profesyoneller (ScreenSpot-Pro çıtası); teknik dereceli kitle anotatörü (VideoCUA) veya kazınmış YouTube (Markov) değil.
- Uygulamalar: paranın olduğu lisanslı ticari araçlar: Premiere, After Effects, Photoshop, Illustrator, DaVinci, Blender, Fusion 360, SolidWorks, AutoCAD, Revit, KiCad, Altium, REAPER, Ableton, Pro Tools, Unreal, Houdini. Windows ve macOS, doğal 4K/HiDPI, çünkü ScreenSpot-Pro hedefleri ekranın %0,07'si.
- Görevler: gerçek brief'lerden çok saatlik, çok uygulamalı iş akışları; teslimat dosyaları ve rubric'ler (GDPval, OSWorld 2.0 tarzı); medyan insan süresi 30 dakikanın üstünde, 2 dakika değil.
- Tek saate senkron ham yakalama: 30 fps video, milisaniye fare kinematiği, modifier'lı tuşlar, pencere/odak olayları, uygulama sunuyorsa a11y ağacı diff'leri, pano, checkpoint'lerde tam dosya durumu anlık görüntüsü. Sadece keyframe değil ham akışları gönder, tüketici AgentNet veya VideoCUA görünümünü kendi türetebilsin.
- Think-aloud ses: canlı operatör anlatımı, kaydedilmiş ve transkript edilmiş, aksiyonlara zaman hizalı, alt hedef başına sonradan uzman yazımı niyet katmanı. Bugün hiçbir açık veri setinde yok.
- Dallanma ve kurtarma verisi: her anlamlı durum değişiminde VM checkpoint'i (ANCHOR kriteri); örneklenmiş alt kümede checkpoint'i fork et ve uzmanın alternatif yolu almasını kaydet; gerçek hata durumlarını uzmanın kurtarmasıyla kaydet (BackBench formalizasyonu). Fork'ları checkpoint id'sine bağlı ağaç olarak sakla ki RL harness'ları restore edebilsin.
- Doğrulama: proje dosyaları üzerinde çalıştırılabilir sonuç kontrolcüleri (DeskCraft, CUA-Gym reward.py), her görev için ikinci uzmanın kör incelemesi (Snorkel KiCad), tekrarlı koşu güvenilirlik etiketleri. Verifier doğruluğunu güven aralığıyla yayınla (ANCHOR %87 raporluyor).
- Paketleme: Harbor görev dizinleri ve reward.json; OpenEnv reset/step/state sarmalayıcı; HUD manifest ve MCP; Cua uyumlu aksiyon primitifleri; SFT için JSONL + PNG keyframe; canary string'li HF host; araştırma için CC BY 4.0 ve doğrulanmış uzman saati başına fiyatlı ticari katman.
- Metadata: uygulama sürümü, eklenti seti, OS build, monitör geometrisi, takma adlı operatör id, görev kökeni, lisans chain-of-custody (Datoric'in iddiası, denetlenebilir hale getirilmiş).
- Ölçek hedefi: makine genişletmesinden önce 2.000-5.000 doğrulanmış uzman iş akışı (200-500 saat). PC-Agent-E (312) ve ANCHOR (168 tohum) bu tohum boyutunun yeterli olduğunu gösteriyor; AgentNet'in +%72-125 ölçekleme eğrileri üstüne sentetik genişletmeyi savunuyor.
Neyi yener: AgentNet ve VideoCUA'yı görev zorluğu, operatör uzmanlığı, ticari uygulama kapsamı, think-aloud ve kurtarma dallarında (ikisinde de yok). Markov'un 12.300 saatini aksiyon akışında (Markov'un açık setinde hiç yok). CutVerse ve DeskCraft'ı çünkü eğitim bölümü olmayan eval setleri. ANCHOR ve CUA-Gym'i çünkü genişletmeleri LLM-yürütmeli; bu spec her tohumda ve her kurtarma dalında insan uzmanı tutuyor, sonra ANCHOR/CUA-Gym makinesinin 0,47 dolar/sentetik trajectory'de çoğaltmasına izin veriyor.
50.000 saatlik Türkiye planıyla bağ: bu spec'e göre 50.000 saat, "tohum" için gerekenin 100 katı. Doğru çerçeve: 50.000 saatin küçük bir kısmı (500-1.000 saat) altın tohum ve kurtarma dalı, kalanı SFT hacmi ve verifier kalibrasyonu. Lab'e iki ayrı ürün olarak sat.
Kaynaklar: AgentNet, OpenCUA, PC-Agent-E, ANCHOR, VideoCUA, Markov computer-use-large, GUI-360, AndroidControl, Fara-1.5, CUA-Gym, Endless Terminals, Güvenilirlik, BackBench, Crab, OpenEnv, Harbor, hud-python, Cua, OSWorld-V2, CutVerse, DeskCraft, ScreenSpot-Pro, Cua-Bench KiCad, Markov Studios.
11. Fiyatlandırma ve birim ekonomi
Pazar çapaları [DOĞRULANDI/RAPOR]:
- Web sitesi replikası ~20K dolar; Slack seviyesi ~300K dolar.
- Task başına 200-2.000 dolar, nadiren 20K (karmaşık yazılım mühendisliği).
- Münhasırlık 4-5x.
- Sözleşme: çeyrek başına 6-7 haneli. Neolab 300-500K.
- HUD bulut: 0,25 dolar/ortam-saat'ten başlıyor.
- Uzman saati: satıcılar lab'e 85-200+ dolar fatura ediyor; uzmana medyan 60 dolar.
- Mechanize: task başına ömür boyu compute ~2.400 dolar; task fiyatı en az 500 dolar olmalı.
PixelNode için önerilen yapı (Faz GTM'den):
| Ürün | Birim | Öneri |
|---|---|---|
| Capture, yaratıcı meslekler | Doğrulanmış uzman saati | Uzmana 35-60, lab'e 110-150. Brüt marj bulut öncesi %50-65 |
| Capture, mühendislik ve CAD | Doğrulanmış uzman saati | Uzmana 60-100, lab'e 160-220 |
| Meslek paketi | Golden image + 100-300 task + verifier | 150-400K, münhasır 4x |
| Ortam saati | GPU VM + snapshot + gateway | Maliyetin 2,5-4x'i |
| Satıcı white-label | Platform ücreti | Faturalanan saatin %15-25'i |
| Lab çerçeve anlaşması | Çeyreklik | 500K/çeyrek taban |
Brüt vs net: Her yatırımcı brütü %60-70 iskonto ediyor. İlk günden iki satır raporla.
12. Hukuk ve uyum: bulgular
Adobe Genel Kullanım Koşulları [DOĞRULANDI, adobe.com/legal/terms.html, 5 Eylül 2026'da okundu]:
- Bölüm 2.2(F): Adobe, yerel veya bulut içeriğini üretken AI eğitmek için kullanmaz. Bölüm 4.3(B)-(C): içerik analitiği için opt-out hakkı.
- Bölüm 17: Kullanıcı, "Hizmetleri veya Yazılımı... doğrudan veya dolaylı olarak herhangi bir makine öğrenimi algoritması veya yapay zeka sistemi yaratmak, eğitmek, test etmek için" kullanamaz. Bu, Premiere veya After Effects içinde yapılan uzman oturumlarını AI eğitim verisi olarak kaydetmenin sözleşme ihlali olarak yorumlanma riski demek. Destedeki "lisansı müşteri tutar, biz host ederiz" cevabı bu maddeyi kapsamıyor.
- Sanallaştırma veya uzaktan erişim yasağı bu genel metinde yok; ürün bazlı lisans koşullarında olabilir.
- Sonuç: Adobe uygulamalarında kayıt için (a) Adobe ile yazılı anlaşma, (b) bu maddeyi kapsayan hukuki görüş, veya (c) Adobe'yi kapsam dışı bırakıp DaVinci, Blender, Unreal, Fusion 360, FreeCAD, Godot gibi izin veren ekosistemlere odaklanmak gerekir. Mevcut Bionluk ilanlarınız zaten "Adobe'yi bulutta lisanslayamıyoruz" diyor; stüdyoların kendi Adobe lisansı ile gelmesi de Bölüm 17'yi çözmez. Bunu diğer üreticiler için de (Autodesk, Dassault, Maxon, Blackmagic, Epic, SideFX) madde madde çıkartın. Ajan 2'nin sonucu bu bölümü genişletecek.
Türkiye KVKK:
- Açık rıza: belirli konuya özgü, bilgilendirmeye dayalı, özgür irade. Ses kaydı kişisel veri; kimlik doğrulamada kullanılmadıkça biyometrik değil.
- Yurt dışı aktarım: KVKK standart sözleşme modülü (standartsozlesme.kvkk.gov.tr) ve Standart Sözleşmeler sayfası (kvkk.gov.tr/Icerik/7929). 2024 değişikliği sonrası standart sözleşmeyle Kurul'a bildirim yolu.
- Kasım 2025 üretken AI rehberi: alternatif hukuki dayanaklar önce değerlendirilmeli, açık rıza son çare; sizin modelinizde açık rıza doğal dayanak.
İşçi sınıflandırması: Mercor'a Ekim 2025'te açılan toplu dava, izleme yazılımı ve bağımsız yüklenici sınıflandırmasını hedef alıyor. PixelNode'un kayıt modeli, "izleme" değil "ürünün kendisi" olarak sözleşmede net tanımlanmalı. Türkiye'de gider pusulası ve serbest meslek makbuzu yolları (Türkiye planında).
Meta MCI [DOĞRULANDI]: Nisan 2026 başladı, klavye, fare, tıklama konumu ve ekran içeriği; opt-out yok; 1.600+ imzalı dilekçe; 20 Mayıs işten çıkarmalarla çakıştı; 22 Haziran 2026'da 45.000 dahili tablonun şirket geneline açık kaldığı güvenlik incelemesi sonrası durduruldu. Yatırımcı sunumunda "ihtiyacı göster, yöntemi anlatma"; katkı sağlayıcı materyallerinde asla.
13. Fikri her teze karşı test: kanıt ve karşı kanıt
| Deste tezi | Destekleyen kanıt | Karşı kanıt | Hüküm |
|---|---|---|---|
| Sınavdan mesleğe geçiş, talep eğrisi | GDPval, OSWorld 2.0 (strict %42, uzun görevde 0), CutVerse %36, DeskCraft %32, KiCad 0/16; Anthropic "Knowledge Work RL" ekibi ilanı; a16z "model artık darboğaz değil" | Sentetik pipeline'lar tarayıcı ve terminalde 1 dolar/task'a çalışıyor; OSWorld-Verified 29 ayda %12'den %86'ya, yani frontier hızlı kapanıyor | Geçer, ama sadece API'siz, verifier'ı insansız olmayan profesyonel yazılım için. Tarayıcı ve ofis görevleri için geçmez |
| İmitasyon için kayıtlı uzman oturumu gerekir | PC Agent-E 312 trajectory +%141; AgentNet ölçekleme +%72-125; Standard Intelligence IDM için 40K saat kontratçı etiketli kayıt gerekti; Meta çalışanlarını kaydediyor; xAI Grok Bot izleyerek öğreniyor | Epoch: insan trajectory'leri çoğunlukla SFT, RL değil; Fara-1.5 %85 otomatik; SI 11M saati insansız etiketliyor; ANCHOR 0,47 dolar/trajectory | Geçer, küçülmüş. Tohum ve kurtarma dalı için insan şart; hacim için makine. Ürünü "az ama altın" olarak fiyatla |
| Pratik için ölçeklenebilir gerçek ortam gerekir | Anthropic 1 milyar+, OpenAI Mac mini alımı, replika 300K'ya kadar, Wing "replikasyon eğitimi altyapısı" kazanan | Cua MIT lisanslı ve kuruşa; HUD 0,10 dolar/saat; Prime Intellect 2.500+ ortam bedava; Windows 365 for Agents 0,40 dolar | Geçer sadece GPU + lisanslı uygulama için. CPU masaüstü ve tarayıcı ortamı emtia |
| "No one owns the technology layer" | Hiçbir sandbox, hyperscaler veya bulut PC satıcısı lisanslı yaratıcı yazılımlı GPU masaüstünü lab'e satmıyor; Fleet/Deeptune/Chakra/Plato/Turing hep klon | Cua + HUD konteyner ve VM katmanına sahip; Scale masaüstü VM satıyor; Mercor Deeptune ile ortam platformuna sahip; Markov gerçek makinede kayıt satıyor | Kısmen geçer. "Expert-desktop layer" de, "technology layer" deme |
| Deep data: gerçek yazılım, gerçek uzman | Mechanize "ucuz task compute israfı"; Sequoia/Foody 150 dolar/saat referans, task 50-10.000; Lambert: lab'ler tek ortama 10M+; Nvidia AfterQuery verisiyle +11,4 GDPval | Chakra "RL Environments are Worthless"; Anderson "beceri öğrenilince değer sıfır"; jeneralist ücretler %40 düştü | Geçer uzman katmanında, jeneralist katmanında geçmez. Halter gerçek |
| Capture Suite farklı: think-aloud, dosya olayları, restore point | Hiçbir açık veri setinde canlı operatör sesi yok; kurtarma dalı verisi hiçbir yerde yok; VideoCUA'nın akıl yürütmesi sonradan yazılmış | Markov senkron olay + anlatım satıyor; Mercor CAD ekran görüntüsü; Vagon Teams'te zaten session + input recording var, yani primitif emtia | Geçer, farklılaştırıcı think-aloud değil checkpoint'ten fork edilen insan kurtarma dalı. Deste bunu vurgulamalı |
| Environment Suite: golden image, fork, byte-identical restore, verifier API, gateway | Wing'in kazanan tanımı tam bu; Crab makalesi checkpoint/restore'u konteynerde çözdü, GPU VM'de değil; ANCHOR fork'u LLM ile yapıyor, insan yok | Önizleme build'i 1,8 saniye restore diyor ama Vagon kullanıcıları 5-10 dakika açılış şikayet ediyor; "1.024 ortam" ve SOC 2 rozetleri doğrulanamıyor | Kanıt gerekiyor. Benchmark yazısı olmadan bu iddialar itibar kaybettirir |
| GTM: frontier lab teknoloji tedarikçisi + vendor white-label + 250K freelancer + kamu verisi | Anthropic 12+ satıcı, OpenAI daha az ama büyük; Mercor/Turing/micro1 zaten CAD ve yaratıcı SKU satıyor, elle | Hiçbir üst kademe satıcı üçüncü taraftan yakalama platformu lisanslamadı; hepsi satın aldı veya içeride kurdu; OpenAI insan verisini içeri alıyor; "250K" doğrulanamıyor ve Handshake 3M, Mercor "5M" diyor | White-label tezi zayıf (lisans değil satın alma davranışı). Doğrudan lab + kendi arzı daha güçlü. 250K'yı sayı olarak değil "zaten lisanslı yazılımda çalışan insanlar" olarak sun |
| $6B+ pazar, triple-digit büyüme | 8,5 milyar brüt, 50+ satıcı; Mercor 2x, micro1 5x, AfterQuery 18 ayda unicorn | Net ~3 milyar; Scale bir yılda yarıya indi; brüt marj Mercor'da %27-33 | Sayıyı güncelle, brüt/net ayır |
| Rakip haritası: vendors solda, env natives altta, biz sağ üstte | Fleet replika, Chakra klon, HUD konteyner, Turing klon | Mercor+Deeptune artık hem vendor hem env; Markov sağ üste çok yakın; Cua altyapı katmanını bedava veriyor; SI talebi yok ediyor | Haritayı yeniden çiz: eksenler "gerçek lisanslı yazılım mı klon mu" ve "uzman kaydı mı ajan rollout'u mu". Sağ üstte Markov ve PixelNode yalnız, Mercor yaklaşıyor |
| Objection: labs build in-house (Meta MCI) | MCI Nisan-Haziran 2026'da rıza ve güvenlikten çöktü; Foody "on lab kendi setini kurmaz" | Lambert: Çin lab'leri satıcı kalitesini kötü buldu, içeride kurdu; OpenAI in-house insan verisi ekibi; Grok Bot müşterilerden bedava demo topluyor | Rebuttal geçer ama "içeri alma" niyet olarak var; ikinci lab ve lab'in kadrolayamayacağı yazılım şart |
| Objection: software licensing, "customer holds license, we host" | Blackmagic, Autodesk, Dassault VDI'ye izin veriyor | Adobe s.17, Maxon 10.4, Epic EULA yazılımı AI eğitmek için kullanmayı yasaklıyor; "müşteri lisansı tutar" bunu çözmez | Rebuttal eksik. Katalogu izin veren üreticilerle başlat, Adobe için üretici anlaşması hedefle |
| Objection: environments lose value once mastered | OSWorld 1.0→2.0 iki yılda; a16z "kalıcı avantaj yukarı taşınıyor" | Anderson'ın tezi tam bu; Fleet'in riski "spending normalization" | Rebuttal geçer görev merdiveni ve tekrar satın alma kanıtıyla |
| Objection: buyer concentration | Scale/Meta kopuşu tarafsızlığı değerli kıldı; Mercor ihlalinden sonra lab'ler ilişkiyi genişletti | Mercor %91 lab; Fleet 1-3 müşteri; lab'ler dokuz haneli bütçeyi aylar içinde taşıyor | Rebuttal geçer sadece ikinci lab ve kurumsal (stüdyo) müşteriyle |
| Vizyon: her şirket kendi ajanını kendi verisiyle eğitir | Applied Compute 1,3 milyar → 3,25 milyar görüşmesi, ~50M run-rate; Prime Intellect "her kurumsal"; NEA verifier tezi; Foody "şirketler kendi zekâsına sahip olur" | Applied Compute ve Prime Intellect bu pazarı çoktan fiyatladı; a16z "ajan 3-4 kat yavaş, biri her çıktıyı inceliyorsa tasarruf yok" | Vizyon geçerli ama sizin değil, henüz. Stüdyo kamasıyla (VFX, oyun) 12-18 ay sonra |
14. En zor 20 soru ve masada verilecek cevaplar
Bölüm 8.7'deki 15 soru "kanıt geçer / kalır" formatında. Buradakiler, PixelNode'a özgü ve masada iki-üç cümlede söylenecek şekilde.
- "OpenAI on binlerce Mac mini aldı. Neden sizden kiralamıyor?" macOS için lisans zorlaması var, Windows GPU için yok. Onlar macOS ortamı kuruyor; biz Premiere, SolidWorks, Unreal'ın çalıştığı Windows GPU masaüstü ve içinde uzman satıyoruz. Aynı haber, lab'lerin gerçek uygulama ortamına capex harcadığını kanıtlıyor.
- "Cua bunu MIT lisansla bedava veriyor." Cua konteyner ve hafif VM; GPU katmanı ve lisanslı yaratıcı yazılımı yok, uzmanı yok. Cua üzerine kurarız, karşısına değil; adaptörümüz olur.
- "Markov aynı şeyi yapıyor ve HF'de bedava dağıtıyor." Markov'un 13.300 saatinin 12.300'ü sesi silinmiş internet videosu; uzman kayıtlı kısmı ~1.000 saat ve uzmanların kendi makinelerinde, lisans kökeni belirsiz. Biz lisanslı makinede, rıza ve chain-of-custody ile, checkpoint'ten fork edilebilir. Onların dağıtım hızını kopyalarız: ilk 60 günde açık veri seti ve benchmark.
- "Standard Intelligence 11M saati insansız etiketliyor. Kayıtlı saat pazarı bitti mi?" IDM'i bootstrap etmek için 40.000 saat kontratçı etiketli kayıt gerekti. Zor alanlarda (CAD, EDA, DCC) etiketleyiciyi eğitecek ve doğrulayacak altın veri hâlâ şart. Ayrıca kazınmış video AI Act özeti ve Bartz tarzı davada (eser başına 3.000 dolar) sorumluluk; rızalı veri daha değerli olur.
- "Mercor 70-90 dolara CAD ekran görüntüsü toplatıyor ve Deeptune'u aldı. Sizi neden almasın veya kopyalamasın?" Kopyalaması için lisanslı GPU masaüstü filosu, uygulama katalogu ve içinde çalışan kullanıcı tabanı kurması gerekir; bu Vagon'un altı yılı. Alması bir çıkış senaryosu ve buna göre veri ve IP haklarını elimizde tutuyoruz. İlk 12 ayda onlara white-label değil, doğrudan lab satışı ve kendi arzımızla gideriz.
- "Adobe s.17 yazılımı AI eğitmek için kullanmayı yasaklıyor. Premiere oturumlarınız yasal mı?" Bugün Adobe'yi bulutta lisanslamıyoruz ve ilk katalog Blackmagic (VM'e açıkça izin veriyor, AI maddesi yok), Blender, Autodesk, KiCad, Godot, FreeCAD üzerine. Adobe ve Maxon için hukuki görüş ve üretici anlaşması hedefi var; Benchling/SAP/Shopify emsalinde üretici ortak olur, hedef değil.
- "Cox v. Mercor izleme yazılımını hedefliyor. Siz kişisel makineye kayıt ajanı kuruyorsunuz." Kurmuyoruz. Kayıt bizim sanallaştırılmış masaüstümüzde, uzmanın kişisel makinesinde değil; uzmana lisans, donanım ve gider yükü yok. Bu, Cox olgu örüntüsünden çıkışın kendisi.
- "Meta MCI 1.600 imza ve veri sızıntısıyla çöktü. Siz farklı mısınız?" MCI opt-out'suz çalışan gözetimiydi ve veri 45.000 tabloda açık kaldı. Bizde opt-in kontratçı, oturum başına silme hakkı, pencere seviyesinde gizlilik ve müşteri başına izolasyon ürünün kendisi. MCI'yi hiçbir katkıcı materyalinde kullanmıyoruz.
- "Fara-1.5 web trajectory'sini 1 dolara üretiyor. Sizin saatiniz 150-300 dolar." Fara'nın karışımı %60 canlı web, %0 gerçek masaüstü uygulaması. Mechanize'ın hesabı: task başına ömür boyu compute 2.400 dolar; ucuz task compute israfı. Bizim saatimiz, replikanın 300K'sına ve boşa giden rollout'a karşı fiyatlanır.
- "OSWorld 2.0 %77,9. Sorun çözülmedi mi?" O kısmi puan; strict en iyi %42 ve 163 dakikayı aşan görevde sıfır. Yaratıcı yazılımda CutVerse %36, DeskCraft %32, KiCad sıfırdan 0/16. Hedef pazarımız tam bu başarısızlık alanı.
- "Vagon 2021'den beri tur almamış, Trustpilot'ta %20 bir yıldız, açılış 5-10 dakika. 1,8 saniye restore'a neden inanayım?" İki farklı iş yükü: tüketici bulut PC soğuk başlangıç ve sıcak havuzdan snapshot restore. Bunu sözle değil, metodolojisi açık bir benchmark yazısıyla kanıtlayacağız; lansmandan önce yayında olur. (Sayı gerçekten tutmuyorsa bu soruya girmeden önce düzelt.)
- "250K sayısı vagon.io'da bile yok." Kümülatif kayıt. Masaya son 90 günde uygulama bazında aktif kullanıcı sayısıyla gelin; o sayı küçük olsa bile gerçek olduğu için daha güçlü.
- "Frontier lab'lerle özel beta iddianızın dışarıda hiç izi yok." Doğru, çünkü sözleşme gereği sessiziz. Logo izni veya en azından referans çağrısı için OpenAI ile konuşuyoruz; bu belgeyi imzalı pilot şartlarıyla birlikte veri odasına koyacağız.
- "Gelirin yüzde kaçı OpenAI ve fesih süresi ne?" Bugün neredeyse tamamı, tıpkı Fleet, Mechanize ve Mercor'un ilk yılı gibi. İkinci lab pilotu ve stüdyo müşterisi 2 çeyrek içinde. Sözleşme yapısını dürüstçe söyle.
- "Brüt mü net mi raporluyorsunuz, marj ne?" İkisini de. Uzman ödemesi düşülmüş net ve tekrar kullanımla yükselen marj; Mercor'un %27-33'ünün üstünde olmalıyız çünkü aynı oturum SFT altın verisi ve fork edilmiş RL episode'ları olarak iki kez satılıyor.
- "Handshake'in yaptığı 250K saat sizin altyapınızda mı, sizin uzmanınız mı?" Altyapımızda, onların uzmanı. Bu, vendor'ların zaten bizim üzerimizde çalıştığını kanıtlıyor. Şimdi kendi arzımızı ekliyoruz.
- "Vendor'lar sizi neden lisanslasın? Hiçbiri bugüne kadar üçüncü taraf yakalama platformu lisanslamadı." Doğru. Bu yüzden ilk 12 ay white-label ana motor değil; doğrudan lab satışı ve kendi arzımız ana motor. Mercor, Turing ve micro1 ile yaratıcı ve CAD trajectory'si için münhasır olmayan pilot deneriz, lisans beklentisiyle değil.
- "Beceri öğrenilince veri setinin değeri sıfır." OSWorld 1.0 iki yılda 2.0 oldu; görev merdivenimiz model kapasitesini izler ve lab ilk sıçramadan sonra almaya devam ettiğinde bu görünür. Ayrıca kurtarma dalı verisi, aynı görevden bin episode üretir; tek seferlik satış değil.
- "Enterprise on-prem vizyonunuzu Applied Compute 3 milyar değerlemeyle yapıyor." Onlar ajan eğitiyor, biz o ajanın öğrendiği veriyi ve ortamı sağlıyoruz; müşteri veya ortak olurlar. Bizim kurumsal kaması VFX ve oyun stüdyoları, zaten Vagon Teams kullanıyorlar.
- "Lab içeri alırsa ne olur?" Emsaller Vercept (Anthropic aldı) ve Mechanize (Google 1,5 milyar görüşmesi): ekip ve araç zinciri veri setinden bağımsız değerli. İkinci lab ve stüdyo müşterisi tek müşteri riskini düşürür.
16. Ezberlenecek 30 sayı
Masada rakam bilmeyen kaybeder. Bunları ezberle.
| # | Sayı | Ne |
|---|---|---|
| 1 | 8,5 milyar / ~3 milyar | Pazar brüt / net, 50+ satıcı, Temmuz 2026 |
| 2 | 1 milyar+ | Anthropic'in yıllık ortam bütçesi (The Information) |
| 3 | 12+ | Anthropic'in ortam satıcısı sayısı |
| 4 | %91 | Mercor gelirinin lab payı, H1 2026 |
| 5 | %27 → %33 → %46 | Mercor brüt marjı 2025, Q2 2026, 2027 projeksiyonu |
| 6 | 2 milyar / 20 milyar | Mercor brüt ARR / değerleme görüşmesi |
| 7 | 500M / 150-200M | micro1 brüt / net, 20 Ağustos 2026 |
| 8 | 3,2 milyar / 100M+ | AfterQuery değerleme (1 Eylül) / run-rate (Nisan) |
| 9 | 60M → 160M | Fleet run-rate Nisan → Q3 projeksiyonu; 725M değerleme |
| 10 | 9,1M → 500M → 1,5 milyar | Mechanize seed, değerleme, Google görüşmesi |
| 11 | 0,10 dolar/saat | HUD bulut ortam fiyatı, taban |
| 12 | 0,044 dolar/vCPU/saat | Cua sandbox fiyatı |
| 13 | 20K / 300K | Web replikası / Slack seviyesi replika maliyeti |
| 14 | 200-2.000, 20K'ya kadar | Task fiyatı |
| 15 | 4-5x | Münhasırlık primi |
| 16 | 480 / 2.400 | Mechanize: task başına RL compute / ömür boyu compute |
| 17 | 0,47 / ~1 | ANCHOR sentetik trajectory / Fara insan web demosu, dolar |
| 18 | 312 / +%141 | PC Agent-E insan trajectory'si / göreli iyileşme |
| 19 | 22.625 | AgentNet trajectory sayısı, en büyük açık insan masaüstü seti |
| 20 | 12.300 / 1.022 | Markov internet videosu / uzman kayıtlı CAD saati |
| 21 | 40.000 / 11M | Standard Intelligence etiketli bootstrap saati / otomatik etiketli saat |
| 22 | %86 / %42 / 0 | OSWorld-Verified en iyi / OSWorld 2.0 strict en iyi / 163 dk üstü görev |
| 23 | %36 / %32 / 0/16 | CutVerse / DeskCraft / KiCad sıfırdan |
| 24 | 1,6 saat / 318 | OSWorld 2.0 medyan insan süresi / araç çağrısı |
| 25 | 70-90 / 125 / 114 | Mercor CAD ekran görüntüsü / Handshake CAD / Mercor ortalama, dolar/saat |
| 26 | 60 / 8-65 | Platformlar arası uzman medyanı / video editör AI trainer, dolar/saat |
| 27 | 350-850K | Anthropic ortam mühendisi maaş bandı |
| 28 | 1.600+ / 45.000 | Meta MCI dilekçe imzası / açık kalan tablo |
| 29 | 3.000 dolar/eser | Anthropic telif uzlaşması, köken fiyatı |
| 30 | 0,53-1,01 / 0,40 | GPU ortam-saati ham maliyet (EC2) / Windows 365 ajan PC |
17. Lab bazında satış kartı
| Lab | Nasıl alıyor | Kim karar veriyor | Ne pitch'lenir | Neyle girilir | Kaçınılacak |
|---|---|---|---|---|---|
| OpenAI | Az satıcı, büyük çek; "yüzlerce UI gym"; insan verisini içeri alma niyeti; on binlerce Mac mini | Agent Post-Training, Frontier Evals and Environments ekibi; Synthetic RL ekibi | Mevcut capture ilişkisini fork edilmiş kurtarma episode'larına genişlet; yaratıcı ve CAD occupation pack | Mevcut sözleşme; logo ve vaka çalışması izni iste | Türkçe anlatım gibi kapsam değişikliklerini yazılı onaysız yapma |
| Anthropic | Ekosistem alıcısı, 12+ satıcı, çoğu alanda sandbox çerçevesine uyum şart, satıcı platformuyla fiyatı bilerek düşürüyor; ilk müşteri olmayı seviyor | Environment Scaling, Universes, Code RL, Knowledge Work RL ekipleri; Data Operations Manager'lar | "Universes" ekibine ultra gerçekçi uzun ufuklu profesyonel ortam; sandbox-runtime uyumlu teslimat | Sandbox çerçevesine uyumlu bir occupation pack demosu; münhasırlık teklifini 4-5x fiyatla masaya koy | Sadece fiyatla rekabet; onlar emtialaştırmak için kurulmuş |
| Google DeepMind | Merkezi değil, ekip ekip; kendi uygulamalarına sahip; Genie 3 ile ortam üretiyor | Gemini computer-use ve ajan ekipleri | Google-dışı profesyonel uygulamalar (Adobe yok, Blender/DaVinci/Autodesk var) | Araştırmacı düzeyinde doğrudan temas, satın alma değil | Docs/Sheets görevleri; kendi verileri var |
| xAI | Hacim; RL Environments Specialist kontratçı 100-200 dolar/saat; Grok Bot ile müşteriden bedava demo | RL ortam ekibi | Filo orkestrasyonu ve ortam-saati fiyatı; hızlı teslimat | Kontratçı ilanları üzerinden ekip lideri | Uzun döngü; onlar hızlı |
| Meta | MCI durduruldu; Scale'e %49 sahip; Mercor'u ihlal sonrası durdurdu; Muse Spark computer-use'da iddialı | Superintelligence Labs | Rıza mimarisi ve müşteri başına izolasyon; MCI'nin çözemediği şey | Sıcak tanıtım şart | MCI'yi adlandırma |
| Microsoft | Fara-1.5 ile en şeffaf veri reçetesi; %0 gerçek masaüstü uygulaması; Copilot Studio CU ajanları GA | Fara ekibi, Microsoft AI | Gerçek masaüstü uygulaması verisi, tam Fara'da eksik olan | Fara makalesine atıfla araştırmacı teması | Windows 365 for Agents ile rekabet gibi konumlanma |
| Nvidia | AfterQuery verisiyle Nemotron'a +11,4 GDPval; model eğitiyor ve veri satın alıyor | Nemotron ekibi | Yaratıcı ve mühendislik occupation pack; Omniverse ekosistemiyle doğal uyum | AfterQuery vaka çalışması emsaliyle | |
| Neolab'ler (Thinking Machines, Reflection, Applied Compute, SSI) | 300-500K sözleşmeler; SFT karışımına atmak kolay | Kurucular | Hazır trajectory paketleri, hızlı | Doğrudan kurucu | Uzun pilot |
| Çin lab'leri | Qwen, Kimi, MiniMax computer-use'da agresif; Lambert'e göre satıcıları kötü bulup içeride kuruyorlar | micro1 gibi satmama kararı ver ve bunu açıkça söyle; ABD lab'leri için güven sinyali |
18. Rakip hızlı cevap kartı
| "X var" derlerse | Sen de |
|---|---|
| Mercor | Uzmanları var, lisanslı GPU masaüstü ve içinde kullanıcı tabanı yok; CAD ekran görüntüsünü kontratçının kendi lisansında elle topluyor. Deeptune klon. Biz gerçek yazılım + rıza + fork. |
| Markov | 13.300 saatin 12.300'ü sesi silinmiş internet videosu; uzman kısmı ~1.000 saat, köken belirsiz. Dağıtım hızlarını kopyalarız, veri kalitesinde geçeriz. |
| Cua | Konteyner ve hafif VM, GPU yok, lisanslı uygulama yok, uzman yok. Üzerine kurarız. |
| HUD | Konteynerde gerçek yazılım ve pazar yeri; 0,10 dolar/saat taban; GPU masaüstü yok. DataVendor'a listeleriz. |
| Fleet | Replika; 60 gün deneme; SDK arşivli; "benchmark overfitting" riski. Replika yapılamayan uygulamalarda oynuyoruz. |
| Scale | Masaüstü VM ve MCP satıyor ama Meta sonrası Google, OpenAI, xAI gitti; tarafsızlık bizim varlığımız. |
| Surge | İçeride kurar, yayınlar, yeniden satmaz; CoreCraft araç bazlı, GUI değil. Sadakat çıtası olarak izleriz. |
| Turing | 83 uygulamada Hindistan ve LatAm anotatörleri, sığ; "1.000+ UI ortamı" iddiası hiçbir kaynakta yok. |
| Handshake | CAD işi prompt yazma, kayıt değil; 125 dolar/saat ücret tabanını belirliyor. Yaratıcı yetenekte rakip, teknolojide değil. |
| AfterQuery | On iki SKU'dan biri computer-use; 3,2 milyar / 100M çok gergin. Benchmark ve hill-climb taktiğini kopyalarız. |
| Standard Intelligence | 40K etiketli saatle bootstrap etti; zor alanda altın veri ve rızalı köken hâlâ şart; kazınmış video AI Act ve telif riski. |
| Chakra | Klon + tarayıcı eklentisiyle kitle trajectory'si; CAD'de yok; açık Pango setine ayda 25 indirme. |
| Huzzle | Avrupa, SOC 2, 300K uzman; kayıt aracı açıklanmıyor; yüksek örtüşme, izle. |
| Windows 365 / WorkSpaces for agents | Ajan çalıştırma, insan yakalama değil; GPU paketi yok; 0,40 dolar/saat CPU. GPU gerektiren uygulamada rakip değil. |
| Adobe AI Assistant / Autodesk MCP | API yolu, piksel değil; hazırlık işi, yaratıcı çekirdek değil; ve ajanların o yazılımda çalışması için hâlâ veri lazım. |
| "Lab içeride kurar" | Meta denedi, rıza ve güvenlikten çöktü; Foody "on lab kendi setini kurmaz"; Lambert: Çin lab'leri satıcı kalitesinden içeri aldı, yani kalite kazanır. |
19. Birim ekonomi modeli, gerçek maliyetlerle
Varsayımlar: Vagon'un GPU katmanı EC2 g4dn/g5/g6 yeniden satışı [GÖRÜŞ]; oturum 3,5 saat; bulut makinesi oturum + 30 dk hazırlık/kapanış = 4 saat; QA oturum başına 20 dk alan uzmanı.
| Kalem | Yaratıcı (Türkiye) | Mühendislik/CAD (Türkiye) | ABD uzman |
|---|---|---|---|
| Uzman ücreti | 35-60 dolar/saat | 60-100 | 100-150 |
| GPU makine (4 saat × 0,53-1,01) | 2,1-4,0 dolar/oturum = 0,6-1,2/saat | aynı | aynı |
| Windows lisansı, depolama, egress | ~0,3/saat | ~0,3 | ~0,3 |
| QA (20 dk × 30 dolar / 3,5 saat) | ~2,9/saat | ~2,9 | ~2,9 |
| Tarama ve onboarding amortismanı (kişi başı 60 dolar / 12 saat) | ~5/saat | ~5 | ~5 |
| Ödeme ve platform komisyonu (%5-15) | 2-9/saat | 3-15 | 5-22 |
| Teslim maliyeti | ~46-78 dolar/saat | ~72-124 | ~114-181 |
| Lab'e fiyat (bölüm 11) | 110-150 | 160-220 | 200-300 |
| Brüt marj | %30-60 | %25-55 | %25-45 |
Okuma: Türkiye tedariki, ABD uzmanına göre 20-30 puan marj avantajı sağlıyor ve bu, Mercor'un %27-33 brüt marjını geçmenin tek yolu. Ama İngilizce anlatım kısıtı (bölüm Türkiye planı) havuzu beşte bire indiriyor; Türkçe anlatım + çeviri kabul edilirse marj hedefi tutar. İkinci kaldıraç: aynı oturumu iki kez satmak (SFT altın trajectory + fork edilmiş RL episode'ları) marjı %60+'a taşır; bu, emtia "saat" satıcısından ayıran şey.
Ortam-saati (sadece RL, insan yok): ham 0,53-1,01 + lisans/depolama 0,3 + orkestrasyon ~0,2 = ~1,0-1,5 dolar/saat maliyet; HUD'un 0,10'una karşı 2,5-4x fiyatla 2,5-6 dolar/saat; sadece GPU gerektiren uygulamada savunulabilir.
Occupation pack (150-400K): golden image (1-2 mühendis-hafta), 100-300 görev (uzman yazımı, task başına 150-500 dolar = 15-150K), verifier (2-4 mühendis-hafta), 2.000-5.000 doğrulanmış iş akışı tohumu. Maliyet 60-200K, marj %40-60; münhasırda 4x.
20. Zaman çizelgesi: pazarı şekillendiren 30 olay
| Tarih | Olay |
|---|---|
| Nis 2024 | OSWorld 1.0 yayınlandı, en iyi ajan %12 |
| Haz 2024 | Adobe ToS tepkisi, Adobe koşulları yeniden yazdı |
| Haz 2025 | Meta, Scale'in %49'unu 14,3 milyara aldı; Google, OpenAI, xAI Scale'i terk etti |
| Tem 2025 | Chemistry "RL Reigns Supreme"; Bloomberg Surge 25 milyar görüşmesi |
| Ağu 2025 | Mechanize "Cheap RL tasks will waste compute"; Prime Intellect Environments Hub; OpenCUA/AgentNet |
| Eyl 2025 | TechCrunch: Anthropic 1 milyar+, Sherwin Wu "short", Mechanize 500K maaş; UI-TARS-2 |
| Eki 2025 | GDPval; Cox v. Mercor davası; HUD SheetBench-50; Mercor 10 milyar |
| Ara 2025 | Simular 21,5M; Turing UI-Vision blogu |
| Oca 2026 | Arena 1,7 milyar; SemiAnalysis "data foundries"; Epoch RL env FAQ; Wing 2030 yazısı; Windows 365 for Agents; Endless Terminals |
| Şub 2026 | Mercor Sepal'i aldı; Anthropic Vercept'i aldı; ANCHOR; Scale RL Environments ürünü; Surge CoreCraft |
| Mar 2026 | Deeptune 43M (a16z); Anthropic Claude computer use masaüstü; Mercor LiteLLM ihlali; VideoCUA; Invisible WeCP |
| Nis 2026 | Meta MCI başladı; AfterQuery 30M @ 300M; Mechanize 9,1M @ 500M; Fleet 750M görüşmesi; Sapphire yazısı; Standard Intelligence 75M; Applied Compute 1,3 milyar; Cua Driver açık kaynak |
| May 2026 | CUA-Gym; CutVerse; Opus 4.8; Lambert Çin lab'leri notu; Copilot Studio CU GA; Luel 31M; Amazon WorkSpaces for agents önizleme |
| Haz 2026 | Fable 5 / Mythos 5; DeskCraft; Cua-Bench KiCad; Meta MCI durdu (22 Haz); Gemini 3.5 Flash CU; Adobe AI Assistant beta; HUD 16M; Handshake Uplimit; Arena 100M ARR; NEA neolab yazısı; XDOF 70M; Fara-1.5 |
| Tem 2026 | GPT-5.6 GA ve ChatGPT Work; Bespoke 40M; Prime Intellect 130M @ 1 milyar; Mercor Deeptune'u aldı ve 20 milyar görüşmesi; OSWorld 2.0 v2; Anthropic 1,5 milyar uzlaşma onayı; WorkSpaces for agents GA; Sequoia/Foody; Lorica kalabalık yazısı |
| Ağu 2026 | Qwen3.8-Max OSWorld-Verified'da birinci; a16z "we've got the data"; Grok Bot; Google-Mechanize 1,5 milyar görüşmesi; micro1 500M; Fara-1.5 v2; Simular OSWorld 2.0 %73 kısmi; Adobe Premiere Assistant; The Information: OpenAI on binlerce Mac mini (31 Ağu) |
| Eyl 2026 | Fable 5.1 (OSWorld 2.0 strict %42); Mercor 397B reçetesi; AfterQuery 3,2 milyar; Applied Compute 3,25 milyar görüşmesi; GPT-6 Astra; Sequoia Foody podcast (4 Eyl); Toloka Shopify vakası |
21. Sözlük, masada geçecek 40 terim
SFT (supervised fine-tuning: uzman demonstrasyonuyla eğitim); RL / RLVR (doğrulanabilir ödülle pekiştirmeli öğrenme); GRPO / RLOO / PPO (post-training algoritmaları, 2026'da GRPO baskın); reward hacking (modelin grader'ı kandırması); verifier / grader (sonucu programatik veya insanla puanlayan); pass@k / pass^k (k denemede en az bir / k denemenin hepsi başarı); trajectory (gözlem-aksiyon dizisi); gold trajectory (uzman referans çözümü); rubric (puanlama kılavuzu); golden image (OS + uygulama + lisans + dosya içeren versiyonlu VM imajı); checkpoint / fork / restore (durumu dondur, dallandır, geri yükle); branch-point data (ANCHOR: durum değişiminde dallanma); recovery episode (hata durumundan kurtarma kaydı); replica / clone / gym (yazılımın taklidi); real-software environment (gerçek binary'nin çalıştığı ortam); computer-use agent, CUA (ekranı görüp fare-klavye kullanan ajan); GUI grounding (ekranda öğeyi bulma); accessibility tree (UI'ın yapısal ağacı); think-aloud (çalışırken sesli düşünme); inverse dynamics model, IDM (iki kareden aksiyonu çıkaran model, Standard Intelligence); MCP (Model Context Protocol, araç sunumu standardı); OpenEnv (Meta/HF Gymnasium tarzı ortam arayüzü); Harbor (Laude Institute görev/verifier çerçevesi, Terminal-Bench 2.0 harness'ı); verifiers (Prime Intellect kütüphanesi); sandbox-runtime (Anthropic izolasyon katmanı); OSWorld-Verified / OSWorld 2.0 / ScreenSpot-Pro / CutVerse / DeskCraft / Cua-Bench / GDPval / SheetBench-50 (benchmark'lar); occupation pack (meslek başına golden image + görev + verifier + uzman havuzu); expert hour (uzman saati, satış birimi); gross vs net revenue (uzman ödemesi öncesi/sonrası); take rate (pazar yerinin tuttuğu pay); exclusivity premium (münhasırlık primi, 4-5x); forward-deployed (müşteride gömülü mühendis); neolab (yeni model lab'i); data foundry (uzman verisi üreticisi); in-housing (lab'in içeride kurması); data wall (kamu metninin tükenmesi); provenance / chain-of-custody (veri kökeni kaydı).
22. Okuma listesi, öncelik sırasıyla
- Epoch AI, "An FAQ on RL environments" (12 Ocak 2026): ekonomi ve içeri alma. epoch.ai/gradient-updates/state-of-rl-envs
- SemiAnalysis, "RL environments and RL for science" (6 Ocak 2026): lab satın alma davranışı.
- a16z, "Can agents use a computer yet? We've got the data" (10 Ağustos 2026).
- Wing VC, "Who will win the RL environment market" ve 2030 yazısı (Ocak 2026).
- Sequoia, Brendan Foody podcast (4 Eylül 2026).
- Mechanize, "Cheap RL tasks will waste compute" (18 Ağustos 2025).
- OSWorld 2.0 makalesi, arXiv 2606.29537, özellikle başarısızlık analizi.
- PC Agent-E, arXiv 2505.13909 ve ANCHOR, arXiv 2602.07153.
- Fara-1.5, arXiv 2606.20785, bölüm 3 (veri karışımı).
- Snorkel Cua-Bench KiCad yazısı (15 Haziran 2026).
- CutVerse ve DeskCraft makaleleri.
- Nathan Lambert, "Notes from inside China's AI labs" (7 Mayıs 2026).
- Benjamin Anderson, "Don't build an RL environment startup" (7 Eylül 2025).
- The Decoder / TechRepublic, OpenAI Mac mini haberi (31 Ağustos 2026).
- Fortune, Meta MCI (21 Nisan 2026) ve Malwarebytes durdurma haberi (23 Haziran 2026).
- Fortune, Mercor/Deeptune (9 Temmuz 2026).
- Adobe General Terms s.17, Maxon EULA 10.4, Blackmagic EULA 1.2: kendin oku.
- Pavlov's List ve rl-list.com computer-use sayfası: rakip dizinleri.
- HUD, "Best platforms for publishing RL environments to model labs" (6 Nisan 2026).
- KVKK Üretken Yapay Zeka Rehberi (Kasım 2025) ve standart sözleşme modülü.
23. İçeride netleştirilecek 15 soru (bu dosya cevaplayamaz)
- OpenAI sözleşmesi: SOW mu MSA mı, süre, fesih, münhasırlık, kayıtların ve türev verinin sahibi, logo ve vaka çalışması izni.
- Q3 10M'nin ne kadarı imzalı, ne kadarı forecast; brüt mü net mi.
- Son 90 günde uygulama bazında aktif Vagon kullanıcısı; Türkiye payı.
- Environment Suite'te bugün gerçekten çalışan: restore süresi (ölçülmüş), paralel instance sayısı (ölçülmüş), fork, verifier API, gateway adaptörleri.
- Önizleme build'indeki 214 golden image, 1.024 ortam, 1,8 saniye, ISO 27001, SOC 2 iddialarının kaynağı; hangisi gerçek, hangisi hedef.
- GPU makine saat maliyeti (gerçek fatura), Windows lisans maliyeti, egress.
- Adobe, Autodesk, Dassault, Maxon, Blackmagic, Epic, SideFX için lisans ve AI maddesi incelemesi; hangi uygulamalarda kayıt yapıldı bugüne kadar.
- Handshake ve diğer vendor'ların 250K saatinde kullanılan yazılımlar ve lisans sahipliği.
- KVKK aydınlatma ve açık rıza metinleri var mı; yurt dışı aktarım için standart sözleşme yapıldı mı; uzman sözleşmesinde IP devri ve silme hakkı.
- Uzman ödeme rayı: bugün nasıl ödeniyor, hangi tüzel kişilikten, gider pusulası mı fatura mı.
- PixelNode tüzel kişiliği: "PixelNode, Inc." nerede, Vagon'la ilişkisi, IP kimde.
- Trustpilot'taki 5-10 dakikalık açılış ve çift ücretlendirme şikayetlerinin kök nedeni ve düzeltildi mi.
- Vagon Virtual sayfasındaki sıfır sayaçlar ve "Continental Bank Group" referansı: kaldırılacak mı.
- Türkçe anlatım + çeviri OpenAI için kabul edilebilir mi.
- İkinci lab ve stüdyo müşterisi konuşmalarının gerçek durumu.
24. Kaynaklar ve yöntem
- 8 araştırma hattı, ~300 birincil ve ikincil kaynak; her bölümün sonunda linkler.
- Etiketleme: DOĞRULANDI (birincil kaynak veya birden fazla güvenilir haber), RAPOR (tek güvenilir kaynak), DEDİKODU (doğrulanmamış), GÖRÜŞ (analist yorumu).
- Doğrulanamayanlar: "10.000 Mac mini" (haber "on binlerce" diyor); Turing'in "1.000+ UI ortamı"; Markov, Refresh, Plato, Habitat, Originator, Collinear yatırım rakamları; Huzzle'ın Apple/Lazard/FT müşterileri; Matrices'in 7 haneli sözleşmeleri; Surge'ün 2026 turunun kapanışı; OSWorld 2.0'ın tam uygulama listesi (HF'de kapılı); "feature not a company" ve "melting ice cube" ifadeleri birebir bulunamadı.
- Ajan çıktılarında iki çelişki: OpenAI'ın insan verisini "içeri aldığı" (SemiAnalysis niyet raporu) vs "içeri almadığı" (satıcıların hâlâ çapa müşterisi). Doğru okuma: niyet var, tamamlanmış geçiş yok.
- Deste iddiaları için düzeltme listesi bölüm 1, madde 4'te.