هوش مصنوعی روی زنجیره ۲٫۸ برابر سریعتر شد: آخرین ارتقای llama.cpp برای سازندگان ICP چه معنایی دارد؟
پروژه llama_cpp_canister در بهروزرسانی ۲۸ ژوئیه از افزایش ۲٫۸ برابری سرعت استنتاج مدلهای زبانی روی زنجیره خبر داده و تنظیمات عملی برای مدلهای Qwen3 و Gemma ارائه کرده است. این پیشرفت مهم است، اما محدودیتهای دستورالعمل، حافظه، تأخیر و هزینه چرخهها را در ICP از بین نمیبرد.

پروژهای جامعهمحور که llama.cpp را داخل کانتینرهای اینترنت کامپیوتر اجرا میکند، یک بهروزرسانی عملی مهم منتشر کرده است. مدیر پروژه در ۲۸ ژوئیه اعلام کرد که نسخه vendored کتابخانه llama.cpp ارتقا یافته و در بارهای کاری این پروژه، سرعتی ۲٫۸ برابر بیشتر ثبت شده است. این بهروزرسانی همچنین پیکربندیهای آمادهای برای اجرای مدلهای Qwen3-0.6B، Qwen3-1.7B و Gemma 3 270M در کانتینر ارائه میکند.
تغییر اصلی فقط استفاده از مدل جدیدتر نیست. مستندات مخزن نشان میدهد که استنتاج در ICP با بودجه ثابت دستورالعملها و سقف حافظه WebAssembly شکل میگیرد. پیکربندی پیشنهادی Qwen3-0.6B سقف حافظه کانتینر را به ۳٫۷۵ گیگابایت افزایش میدهد، کش کلید-مقدار را کوانتایز میکند و اندازه batch را از مقادیر بزرگ پیشفرض کاهش میدهد. طبق مستندات پروژه، این کار حدود ۲ گیگابایت از حافظه بافرهای محاسباتی آزاد میکند و در محیط آزمایششده، زمینهای با ۱۶٬۳۸۴ توکن را عملی میسازد.
اندازهگیریهای مخزن مصالحه را روشن میکنند. Qwen3-0.6B برای تولید حدود ۲۰ توکن در هر فراخوانی update تنظیم شده و سقف فراخوانی نخست آن تقریباً ۲۵ تا ۲۹ توکن است. مدل بزرگتر Qwen3-1.7B در آزمایشی با زمینه کوچکتر، حدود شش توکن در هر فراخوانی ثبت کرده است. Gemma 3 270M سقف بالاتری در هر فراخوانی دارد، اما مدل بسیار کوچکتری است. بنابراین کاربرد نزدیکمدت این فناوری، عاملهای هدفمند و گردشکارهای محدود است، نه جایگزینی برای چتباتهای عمومی.
این بهروزرسانی ICGPT را نیز به یک استودیوی طراحی prompt روی زنجیره تبدیل میکند. هدف اعلامشده، کمک به توسعهدهندگان برای بهینهسازی prompt پیش از پرداخت هزینه چرخهای اجرای مکرر استنتاج روی شبکه اصلی است. این تغییر در فرایند توسعه مهم است: طراحی prompt اکنون بخشی از مهندسی منابع محسوب میشود؛ در کنار کوانتایزیشن، اندازه زمینه، اندازه batch و تنظیمات حافظه کانتینر.
بُعد دیگری از این کار، قابلیت راستیآزمایی است. مخزن، بررسی SHA-256 فایل مدل، ذخیرهسازی در حافظه پایدار، تستهای smoke و روشی برای راستیآزمایی مستقل WebAssembly مستقرشده را مستند کرده است. این رویهها اهمیت دارند، زیرا مدل روی زنجیره تنها زمانی برای توسعهدهنده مفید است که بتواند مشخص کند دقیقاً چه کد و چه فایل مدلی در حال اجراست.
برداشت ایمنیمحور باید از تیتر اصلی محتاطانهتر باشد. این پروژه جامعهمحور است، نه انتشار رسمی شبکه از سوی DFINITY؛ و سرعت ۲٫۸ برابری و سقفهای توکن گزارششده، اندازهگیریهای خود پروژهاند و آزمون مستقل محسوب نمیشوند. استنتاج روی زنجیره همچنان در هر update هزینه بودجه دستورالعملی دارد و زمینههای بزرگتر حتی وقتی گفتوگو کوتاه است، حافظه بیشتری مصرف میکنند. مستندات خود پروژه نیز میگوید استنتاج چرخه مصرف میکند و بهدلیل گرانبودن این بارهای کاری، استودیوی prompt فعلاً به دسترسی زودهنگام محدود شده است.
با این حال، برای سازندگان ICP این تحول معنادار است. فاصله میان «هوش مصنوعی میتواند در یک کانتینر اجرا شود» و «یک مدل کوچک و هدفمند میتواند بهعنوان مؤلفهای قابلراستیآزمایی روی زنجیره اداره شود» کمتر شده است. الگوی عملی اکنون روشنتر است: یک مدل GGUF کوچک انتخاب کنید، خروجی هر update را محدود کنید، اندازه زمینه را آگاهانه تعیین کنید، فایل را راستیآزمایی کنید و چرخهها و حافظه را محدودیتهای اصلی برنامه در نظر بگیرید.
خبرخوان را در ایمیل بگیرید
هر سیگنال تازه، مستقیم از خط تولید. بدون مزاحمت، لغو عضویت در هر زمان.


