EN
→ بازگشت به خبرخوان
شمارهٔ ۰۲۱۳Internet Computer۲ دقیقه۲ منبع

هوش مصنوعی روی زنجیره ۲٫۸ برابر سریع‌تر شد: آخرین ارتقای llama.cpp برای سازندگان ICP چه معنایی دارد؟

پروژه llama_cpp_canister در به‌روزرسانی ۲۸ ژوئیه از افزایش ۲٫۸ برابری سرعت استنتاج مدل‌های زبانی روی زنجیره خبر داده و تنظیمات عملی برای مدل‌های Qwen3 و Gemma ارائه کرده است. این پیشرفت مهم است، اما محدودیت‌های دستورالعمل، حافظه، تأخیر و هزینه چرخه‌ها را در ICP از بین نمی‌برد.

اشتراک‌گذاری
رایانه اینترنتی (ICP)
هوش مصنوعی روی زنجیره ۲٫۸ برابر سریع‌تر شد: آخرین ارتقای llama.cpp برای سازندگان ICP چه معنایی دارد؟
تصویر: تولید هوش مصنوعی

پروژه‌ای جامعه‌محور که llama.cpp را داخل کانتینرهای اینترنت کامپیوتر اجرا می‌کند، یک به‌روزرسانی عملی مهم منتشر کرده است. مدیر پروژه در ۲۸ ژوئیه اعلام کرد که نسخه vendored کتابخانه llama.cpp ارتقا یافته و در بارهای کاری این پروژه، سرعتی ۲٫۸ برابر بیشتر ثبت شده است. این به‌روزرسانی همچنین پیکربندی‌های آماده‌ای برای اجرای مدل‌های Qwen3-0.6B، Qwen3-1.7B و Gemma 3 270M در کانتینر ارائه می‌کند.

تغییر اصلی فقط استفاده از مدل جدیدتر نیست. مستندات مخزن نشان می‌دهد که استنتاج در ICP با بودجه ثابت دستورالعمل‌ها و سقف حافظه WebAssembly شکل می‌گیرد. پیکربندی پیشنهادی Qwen3-0.6B سقف حافظه کانتینر را به ۳٫۷۵ گیگابایت افزایش می‌دهد، کش کلید-مقدار را کوانتایز می‌کند و اندازه batch را از مقادیر بزرگ پیش‌فرض کاهش می‌دهد. طبق مستندات پروژه، این کار حدود ۲ گیگابایت از حافظه بافرهای محاسباتی آزاد می‌کند و در محیط آزمایش‌شده، زمینه‌ای با ۱۶٬۳۸۴ توکن را عملی می‌سازد.

اندازه‌گیری‌های مخزن مصالحه را روشن می‌کنند. Qwen3-0.6B برای تولید حدود ۲۰ توکن در هر فراخوانی update تنظیم شده و سقف فراخوانی نخست آن تقریباً ۲۵ تا ۲۹ توکن است. مدل بزرگ‌تر Qwen3-1.7B در آزمایشی با زمینه کوچک‌تر، حدود شش توکن در هر فراخوانی ثبت کرده است. Gemma 3 270M سقف بالاتری در هر فراخوانی دارد، اما مدل بسیار کوچک‌تری است. بنابراین کاربرد نزدیک‌مدت این فناوری، عامل‌های هدفمند و گردش‌کارهای محدود است، نه جایگزینی برای چت‌بات‌های عمومی.

این به‌روزرسانی ICGPT را نیز به یک استودیوی طراحی prompt روی زنجیره تبدیل می‌کند. هدف اعلام‌شده، کمک به توسعه‌دهندگان برای بهینه‌سازی prompt پیش از پرداخت هزینه چرخه‌ای اجرای مکرر استنتاج روی شبکه اصلی است. این تغییر در فرایند توسعه مهم است: طراحی prompt اکنون بخشی از مهندسی منابع محسوب می‌شود؛ در کنار کوانتایزیشن، اندازه زمینه، اندازه batch و تنظیمات حافظه کانتینر.

بُعد دیگری از این کار، قابلیت راستی‌آزمایی است. مخزن، بررسی SHA-256 فایل مدل، ذخیره‌سازی در حافظه پایدار، تست‌های smoke و روشی برای راستی‌آزمایی مستقل WebAssembly مستقرشده را مستند کرده است. این رویه‌ها اهمیت دارند، زیرا مدل روی زنجیره تنها زمانی برای توسعه‌دهنده مفید است که بتواند مشخص کند دقیقاً چه کد و چه فایل مدلی در حال اجراست.

برداشت ایمنی‌محور باید از تیتر اصلی محتاطانه‌تر باشد. این پروژه جامعه‌محور است، نه انتشار رسمی شبکه از سوی DFINITY؛ و سرعت ۲٫۸ برابری و سقف‌های توکن گزارش‌شده، اندازه‌گیری‌های خود پروژه‌اند و آزمون مستقل محسوب نمی‌شوند. استنتاج روی زنجیره همچنان در هر update هزینه بودجه دستورالعملی دارد و زمینه‌های بزرگ‌تر حتی وقتی گفت‌وگو کوتاه است، حافظه بیشتری مصرف می‌کنند. مستندات خود پروژه نیز می‌گوید استنتاج چرخه مصرف می‌کند و به‌دلیل گران‌بودن این بارهای کاری، استودیوی prompt فعلاً به دسترسی زودهنگام محدود شده است.

با این حال، برای سازندگان ICP این تحول معنادار است. فاصله میان «هوش مصنوعی می‌تواند در یک کانتینر اجرا شود» و «یک مدل کوچک و هدفمند می‌تواند به‌عنوان مؤلفه‌ای قابل‌راستی‌آزمایی روی زنجیره اداره شود» کمتر شده است. الگوی عملی اکنون روشن‌تر است: یک مدل GGUF کوچک انتخاب کنید، خروجی هر update را محدود کنید، اندازه زمینه را آگاهانه تعیین کنید، فایل را راستی‌آزمایی کنید و چرخه‌ها و حافظه را محدودیت‌های اصلی برنامه در نظر بگیرید.

برچسب‌هاInternet ComputerICPهوش مصنوعی روی زنجیرهllama.cpp
منابع مستند۲ مرجع
  1. [۰۱]Llama.cpp on the Internet Computer — Internet Computer Developer Forumforum.dfinity.org
  2. [۰۲]llama_cpp_canister: llama.cpp for the Internet Computer — GitHubgithub.com
خواندنی بعدی

خبرخوان را در ایمیل بگیرید

هر سیگنال تازه، مستقیم از خط تولید. بدون مزاحمت، لغو عضویت در هر زمان.

خوراک RSS در دسترس · بدون هرزنامه