gik|iewicz

szukaj
Needle2 – model LLM 14 MB do agentów na telefonach i robotach

Needle2 – model LLM 14 MB do agentów na telefonach i robotach

Needle2 to agentowy model LLM o rozmiarze zaledwie 14 MB, zaprojektowany do działania bezpośrednio na urządzeniach mobilnych, takich jak telefony, smartwatche i roboty. Projekt trafił na platformę Show HN, gdzie zyskał uznanie społeczności. To rozwiązanie wpisuje się w trend miniaturyzacji modeli językowych, porównywalny do wcześniejszych eksperymentów opisanych na blogu w artykule Show HN: Needle: Przełożyliśmy wywoływanie narzędzi z Gemini na model o rozmiarze 26M.

TL;DR: Needle2 to 14-megabajtowy model agentowy zoptymalizowany pod kątem urządzeń brzegowych. Pozwala na uruchamianie zadań wieloetapowych bez konieczności przesyłania danych do chmury. Projekt pokazuje, jak niewielkie mogą być dziś modele zdolne do wywoływania narzędzi i planowania akcji na lokalnym sprzęcie.

Jak działa model agentowy Needle2 na urządzeniach mobilnych?

Needle2 działa jako skompresowany model językowy zdolny do planowania oraz wywoływania narzędzi w środowisku lokalnym. Jego architektura została zoptymalizowana pod kątem ograniczeń pamięci i mocy obliczeniowej urządzeń przenośnych. Model przetwarza instrukcje i podejmuje decyzje bez konieczności łączenia się z serwerami. To bezpośrednia odpowiedź na problem rosnących kosztów chmurowych.

Zatem dane użytkownika pozostają na urządzeniu, co eliminuje opóźnienia sieciowe. Ponadto projekt udowadnia, że agentowe zachowania można zreplikować w bardzo małej przestrzeni dyskowej. Podobne podejście stosuje Liquid AI w swoim modelu LFM2.5-2.6B, który uruchamia się bezpośrednio na telefonach i robotach, jak podaje AI/TLDR.

Jakie są główne zalety uruchamiania lokalnego modelu LLM?

Lokalne modele gwarantują pełną prywatność danych, ponieważ informacje nie opuszczają pamięci urządzenia. Co więcej, eliminują koszty związane z odwołaniami do zewnętrznych interfejsów programistycznych. Model wykonuje obliczenia bezpośrednio na procesorze smartfona lub smartwatcha. Przepustowość sieci przestaje mieć znaczenie.

Dlatego produkcja lokalnych agentów staje się opłacalna dla szerokiego grona twórców. W rezultacie programiści mogą integrować zaawansowane funkcje bez abonamentów. Warto przeanalizować ten trend, ponieważ omawiane rozwiązania drastycznie obniżają próg wejścia. Więcej o konfiguracji lokalnej znajdziesz w tekście Przestałem płacić za ChatGPT i przeszedłem na lokalny model LLM działający na moim laptopie.

Jak Needle2 wypada na tle innych małych modeli?

Needle2 wyróżnia się rozmiarem 14 MB na tle konkurencyjnych konstrukcji ważących setki megabajtów lub gigabajty. Liquid AI zaprezentował niedawno model LFM2.5-2.6B, który również działa na urządzeniach brzegowych, ale jest znacznie większy. Został on wytrenowany na około 34 bilionach tokenów, według informacji z profilu Liquid AI na platformie X. Needle2 celuje w jeszcze bardziej restrykcyjne środowiska sprzętowe.

Choć LFM2.5 oferuje szerokie możliwości, Needle2 skupia się na absolutnej minimalizacji. Na przykład uruchomienie agenta na smartwatchu wymaga radykalnego cięcia zbędnych parametrów. Oto kluczowe różnice między omawianymi podejściami do lokalnej sztucznej inteligencji:

  • Needle2 zajmuje zaledwie 14 MB pamięci masowej.
  • Model LFM2.5-2.6B posiada 2,6 miliarda parametrów zoptymalizowanych pod urządzenia mobilne.
  • LFM2.5 został wytrenowany na około 34 bilionach tokenów danych.
  • Projekty takie jak Needle2 skupiają się na wywoływaniu konkretnych narzędzi zamiast ogólnej konwersacji.
  • Oba podejścia eliminują koszty operacyjne związane z chmurą.

Jakie problemy rozwiązuje agentowy model na smartwatchu?

Agent działający na smartwatchu rozwiązuje problem ciągłego wysyłania zapytań do chmury poprzez interfejsy API. Model analizuje komendy głosowe i uruchamia odpowiednie funkcje systemu operacyjnego bezpośrednio na nadgarstku użytkownika. Znacząco skraca to czas reakcji asystenta. Odpowiedź pojawia się natychmiast.

Z tego powodu urządzenia wearable zyskują realną autonomię działania poza zasięgiem sieci Wi-Fi lub komórkowej. Innymi słowy, smartwatch staje się niezależnym węzłem obliczeniowym. Moim zdaniem to właśnie w tej kategorii sprzętowej lokalne agenty znajdą najszybsze praktyczne zastosowanie. Podobne mechanizmy działania opisywałem wcześniej w wpisie Show HN: Smart model routing directly in Claude, Codex and Cursor.

Jakie narzędzia i frameworki współpracują z Needle2?

Needle2 obsługuje standardowe wywoływanie funkcji, co pozwala na integrację z popularnymi środowiskami agentowymi. Model komunikuje się z otoczeniem poprzez ustrukturyzowane wywołania JSON. Dzięki temu programiści mogą podpiąć dowolne API bez modyfikacji kodu źródłowego modelu. Architektura bazuje na kompilacji zachowań do minimalnej reprezentacji wag.

Oto kluczowe elementy ekosystemu współpracujące z takimi mikro-modelami:

  • Format JSON do strukturyzowania zapytań i odpowiedzi agenta.
  • Standardowe biblioteki do wywoływania funkcji systemowych na urządzeniach mobilnych.
  • Lokalne bazy danych przechowujące kontekst rozmowy w pamięci urządzenia.
  • Interfejsy API systemu operacyjnego do sterowania czujnikami oraz aktywatorem sprzętowym.
  • Zewnętrzne routery, które potrafią przełączać się między modelem lokalnym a chmurowym.
  • Cienkie klienty uruchamiające model w środowisku piaskownicy systemowej.
  • Moduły kwantyzacji redukujące rozmiar wag do granic możliwości.

Zatem integracja nie wymaga specjalistycznego sprzętu. Ponadto model może być pakowany jako zwykły plik binarny wewnątrz aplikacji mobilnej. Projekt Needle2 udowadnia, że wywoływanie narzędzi to zadanie, które można skompresować do zaledwie 14 MB. To fizyka ograniczeń pamięci.

Czym różni się trening agentowy od tradycyjnego dostrajania LLM?

Trening agentowy skupia się na nauce wywoływania narzędzi i planowania wieloetapowego, a nie na generowaniu swobodnego tekstu. Tradycyjne modele są trenowane na ogromnych korpusach tekstów, jak LFM2.5-2.6B wytrenowany na około 34 bilionach tokenów, według Liquid AI na platformie X. Needle2 odrzuca tę ścieżkę na rzecz specjalizacji.

Zamiast uczyć się poezji, model trenuje się wyłącznie na interakcjach z interfejsami programistycznymi. W rezultacie mały model nadrabia brak ogólnej wiedzy precyzją w konkretnej dziedzinie. Na przykład agent na smartwatchu uczy się tylko wywoływać kalkulator, nawigację, czy wiadomości. To drastycznie tnie wymagania sprzętowe.

Co więcej, takie podejście przypomina destylację zachowań z większych modeli. Zamiast tworzyć nową architekturę, twórcy przenoszą funkcje z modeli takich jak Gemini do mniejszych konstrukcji. Podobne metody omawiałem wcześniej w tekście Show HN: Needle: Przełożyliśmy wywoływanie narzędzi z Gemini na model o rozmiarze 26M. To czysta optymalizacja.

Jakie są koszty uruchomienia Needle2 w porównaniu do modeli chmurowych?

Koszty uruchomienia Needle2 sprowadzają się wyłącznie do zużycia energii elektrycznej na urządzeniu docelowym. Model eliminuje całkowicie opłaty za zapytania API, które w przypadku chmur publicznych potrafią być znaczne. Na przykład regularne odwołania do zaawansowanych modeli mogą kosztować dziesiątki dolarów miesięcznie. Needle2 działa za ułamek centa.

Ponadto brak konieczności utrzymywania serwerów zmniejsza ślad węglowy całego systemu. Koszt krańcowy każdego dodatkowego uruchomienia agenta jest zerowy, co potwierdza AI/TLDR w kontekście lokalnych modeli agentowych. To upraszcza budżetowanie projektów sprzętowych.

Z tego powodu urządzenia peryferyjne mogą działać w trybie ciągłym. Choć wymaga to naładowania baterii, oszczędności na API są wymierne. Więcej o ekonomicznych aspektach lokalnej sztucznej inteligencji znajdziesz w artykule Przestałem płacić za ChatGPT i przeszedłem na lokalny model LLM działający na moim laptopie.

Jakie są ograniczenia modeli o rozmiarze 14 MB?

Głównym ograniczeniem modelu Needle2 jest brak zdolności do prowadzenia otwartych konwersacji na dowolny temat. Model posiadający 14 MB nie jest w stanie magazynować wiedzy ogólnej o świecie. Jego słownictwo oraz zdolności rozumowania są rygorystycznie ograniczone do wywoływania narzędzi. To system wąski, ale bardzo precyzyjny.

Jednakże w środowiskach ograniczonych sprzętowo ta wąskość staje się największą zaletą. Na przykład roboty przemysłowe nie potrzebują dyskutować o filozofii, lecz precyzyjnie sterować ramieniem mechanicznym. Model po prostu mapuje wejście na konkretną funkcję sterującą. Szybkość reakcji jest natychmiastowa.

Mimo to programiści muszą stworzyć własne fallbacki dla nieobsługiwanych zapytań. Często stosuje się hybrydowe podejście z wykorzystaniem zewnętrznego routingu, co opisano w Show HN: Smart model routing directly in Claude, Codex and Cursor. Wtedy skomplikowane zadania trafiają do chmury.

CechaNeedle2 (14 MB)Tradycyjny model chmurowy
Rozmiar14 MBSetki GB
Zasoby obliczenioweLokalne CPU/NPUKlastry GPU
Koszt krańcowyZerowyOpłata za token
FunkcjaWywoływanie narzędziGenerowanie tekstu
PrywatnośćPełna lokalnaWymaga transferu danych

Jak wdrożyć Needle2 we własnym projekcie sprzętowym?

Wdrożenie Needle2 wymaga pobrania skompilowanego pliku wag oraz integracji go z silnikiem wnioskowania obsługującym małe architektury. Następnie programista musi zdefiniować listę dostępnych narzędzi w formacie zgodnym ze schematem JSON. Model działa wtedy jako router decydujący o wyborze odpowiedniej funkcji systemowej. Całość mieści się w aplikacji.

Otóż proces ten przypomina budowanie dedykowanych rozwiązań z opisów takich jak Wytrenuj własny model LLM od zera. Różnica polega na ekstremalnej kompresji i wąskim zakresie zadań. Uruchomienie nie wymaga skomplikowanych środowisk uruchomieniowych ani zewnętrznych zależności. Wystarczy podstawowe środowisko programistyczne.

Co więcej, model można osadzić w systemach operacyjnych smartwatchy oraz mikrokontrolerów. Podobnie jak w eksperymentach z Show HN: Sharp od Apple uruchomiony w przeglądarce dzięki ONNX Runtime Web, kluczowa jest optymalizacja. Małe modele otwierają drogę do autonomicznych urządzeń. To bardzo konkretne narzędzie.

Często zadawane pytania

Czy Needle2 utrzymuje kontekst długiej rozmowy?

Needle2 nie utrzymuje długiego kontekstu rozmowy, ponieważ jego 14 MB wag jest przeznaczonych wyłącznie dla wywoływania narzędzi. Wymaga zewnętrznego bufora w pamięci urządzenia.

Jakie sprzętowe minimum jest wymagane do uruchomienia Needle2?

Minimum to urządzenie z dostępem do 14 MB wolnej pamięci oraz podstawowym procesorem obsługującym kwantyzację. Model LFM2.5-2.6B wymaga znacznie więcej zasobów, co potwierdza GIGAZINE.

Czy Needle2 radzi sobie z wieloetapowymi zadaniami logicznymi?

Tak, model potrafi zaplanować sekwencję wywołań narzędzi, ale ogranicza się do zadań sprzętowych. Nie rozwiąże ogólnych problemów logicznych.

Czy można samodzielnie dotrenować Needle2 pod własne API?

Tak, ponieważ architektura obsługuje standardowy format JSON, można dotrenować model na własnych danych wywołań. Projekt pokazuje, że mapowanie interfejsów zajmuje niewiele miejsca.

Podsumowanie

Needle2 udowadnia, że agentowe zachowania nie wymagają gigabajtów wag ani potężnych klastrów GPU. Projekt sprowadza planowanie i wywoływanie narzędzi do zaledwie 14 MB, co otwiera drogę do pełnej autonomii urządzeń wearable oraz robotów. Po pierwsze, eliminuje to koszty operacyjne związane z chmurą. Po drugie, gwarantuje całkowitą prywatność danych użytkownika. Po trzecie, radykalnie skraca czas reakcji asystenta na urządzeniach mobilnych. Po czwarte, obniża próg wejścia dla twórców oprogramowania wbudowanego. Zatem jeśli budujesz aplikację mobilną lub system wbudowany, rozważ zastąpienie zdalnego API lokalnym mikro-agentem. To krok w stronę niezależności.