جهش مرکور به ارزش ۲۰ میلیارد دلاری نشان میدهد گلوگاه بعدی هوش مصنوعی محاسبات نیست

مرکور (Mercor) کار خود را بهعنوان یک پلتفرم استخدامی آغاز کرد که از هوش مصنوعی برای تطبیق پیمانکاران با مشاغل استفاده میکرد. تا سپتامبر ۲۰۲۶، ارزش این شرکت به حدود ۲۰ میلیارد دلار رسید — دو برابر ارزشگذاری آن ده ماه پیش — و کسبوکار پشت این رقم دیگر تقریباً هیچ ارتباطی با استخدام ندارد. مرکور اکنون محیطهای کاری شبیهسازیشدهای میسازد که در آنها مدلهای هوش مصنوعی وظایف را تمرین میکنند و بر اساس نتایج نمره میگیرند، و این تغییر روشنترین شاهد است بر اینکه گلوگاه واقعی صنعت هوش مصنوعی از قدرت محاسباتی خام فاصله گرفته است.
این دسته «محیطهای RL» (یادگیری تقویتی) نامیده میشود و اکنون آزمایشگاههای پیشرو بخش رو به رشدی از بودجه آموزش خود را در آن صرف میکنند. گفته میشود آنتروپیک درباره هزینهکرد بیش از یک میلیارد دلار برای محیطها فقط در سال ۲۰۲۶ بحث کرده است. رهبران پژوهشی OpenAI علناً گفتهاند که این شرکت انتظار دارد محاسبات یادگیری تقویتی بهزودی از آنچه برای پیشآموزش هزینه میکند فراتر رود.
از برچسبگذاری داده تا ساخت زمین تمرین
خط تولید قدیمی آموزش مدل ساده بود: متن را جمعآوری یا مجوزدار کنید، بخشی از آن را برچسب بزنید و مدل را روی مجموعه حاصل پیشآموزش دهید. این خط تولید هنوز وجود دارد، اما برای نوع رفتار عاملمحور و چندمرحلهای که آزمایشگاهها اکنون میخواهند — نوشتن کد کارآمد در یک مخزن واقعی، بستن یک چرخه حسابداری، مذاکره برای حل یک تیکت پشتیبانی چندمرحلهای — بازده کاهنده دارد.
نمیتوان این را از یک مجموعهداده ایستا آموخت. به محیطی شبیهسازیشده نیاز دارید که مدل بتواند در آن یک اقدام انجام دهد، پیامد واقعی آن را ببیند و بر اساس نتیجهای قابل تأیید نمره بگیرد. ساخت این محیطها — یک سیستم حسابداری آزمایشی کارکردی، یک پایگاه کد قابل مرور با باگهای واقعی، یک شبیهساز پشتیبانی مشتری چندمرحلهای — رشتهای واقعاً متفاوت از برچسبگذاری داده است، نزدیکتر به ساخت یک بازی ویدئویی تا حاشیهنویسی یک صفحهگسترده.
حرکتهای محصولی خود مرکور این داستان را روایت میکنند. این شرکت در مارس ۲۰۲۶ APEX-SWE، یک محیط معیار مهندسی نرمافزار، را عرضه کرد. در ژوئیه با شرکت مدیریت هزینه Ramp همکاری کرد تا APEX-Accounting را عرضه کند. هر دو خرید پشت این توانایی — Sepal AI در فوریه و Deeptune در ژوئیه — صراحتاً برای ساخت توان مهندسی محیط خریداری شدند، نه افزایش نیروی انسانی برچسبگذاری.
چرا محیطها از نظر اقتصادی بر داده بیشتر برتری دارند
اقتصاد این موضوع، ارزشگذاری را توضیح میدهد. یک مجموعهداده برچسبخورده یکبار استفاده و یکبار پالایش میشود و در نهایت اشباع میشود — مدلی که فراتر از نقطهای خاص روی همان نمونههای ایستا آموزش ببیند، دیگر بهبود نمییابد. یک محیط بهخوبی ساختهشده قابل استفاده مجدد و انباشتی است: هر نسل جدید مدل میتواند دوباره روی آن آموزش ببیند، و خود محیط میتواند با پیشرفت مدلها سختتر شود.
همین قابلیت استفاده مجدد است که توضیح میدهد چرا شرکتی که محیط میفروشد میتواند به ازای هر قرارداد بیشتر از شرکتی که حجم معادل نمونههای برچسبخورده میفروشد، دریافت کند، و چرا عنوان شغلی «مهندس محیط RL» از عنوانی که در سال ۲۰۲۴ بهسختی وجود داشت، تا سال ۲۰۲۶ به یکی از پردرآمدترین و سختترین نقشها برای استخدام در هوش مصنوعی تبدیل شد.
سه گروه در حال رقابت برای تصاحب این لایه
بازار به سه گروه تقسیم شده است. گروه اول شرکتهای داده انسانی هستند که بهشدت به سمت محیطها چرخیدند — مرکور، Surge AI (با درآمد گزارششده حدود ۱.۲ میلیارد دلار)، Scale AI، Turing و Centific. گروه دوم استارتاپهای بومی محیط هستند که هرگز برچسبگذاری داده سنتی انجام ندادهاند: Mechanize، Fleet AI، HUD، Veris AI، Plato و Bespoke Labs. گروه سوم اکوسیستمهای باز و غیرمتمرکز مانند Prime Intellect هستند.
معنای عملی این موضوع
برای مهندسان: مهندسی محیط اکنون یک تخصص مجزا و با دستمزد خوب است که ارزش یادگیری عمدی دارد. برای خریداران سازمانی که ادعاهای یک فروشنده هوش مصنوعی درباره یک گردش کار خاص را ارزیابی میکنند، سؤال مفید دیگر «چقدر داده آموزش دیدهاید» نیست، بلکه «چه محیطی برای تأیید این رفتار ساختید و چقدر به گردش کار واقعی من نزدیک است.» برای بنیانگذاران در حوزههای مجاور، لایه محیطها هنوز بهاندازه کافی جوان است که محیطهای تخصصی برای بخشهای کمخدمت — عملیات بهداشتی، لجستیک، مشاغل فنی — سرزمین باز باقی بماند.
داستان محاسبات هنوز تمام نشده. اما برای نسل بعدی مدلها، محدودیت اصلی بهطور فزایندهای این است که آیا آزمایشگاهها نسخه شبیهسازیشده کافی از دنیای واقعی برای آموزش دارند یا نه — و چه کسی بهترین نسخههای این شبیهسازی را کنترل میکند.