AppleLLM: Siri og Apples behov for kunstig intelligens

  • Apple forbereder sin egen LLM for at forbedre Siri og styrke Apple Intelligence.
  • Hybridarkitektur: 3B on-premises-model, privat cloud med Apple Silicon og verificerbar privatlivsbeskyttelse.
  • Åbning for udviklere med Foundation Models og nye API'er til intelligente oplevelser.
  • Udfordringer i det virkelige liv med LLM: Grænser for ræsonnement, tests som Tower of Hanoi og en ansvarlig tilgang.

Apple AI og LLM

Samtalen omkring Apple og virksomhedens næste store spring inden for kunstig intelligens er ved at blive varm, og udtrykket AppleLLM høres allerede højt og tydeligt i Cupertinos gange. Mellem troværdige lækager, fremskridt inden for Apple Intelligence og en Siri, der gennemgår en komplet transformation , peger alt på, at Apples egen sprogmodel er tættere end nogensinde på at blive en realitet og en central del af virksomhedens strategi.

Ud over støjen hober tekniske data, produktbeslutninger og endda akademisk kritik op, hvilket tegner et komplekst billede. Apple åbner sin platform for udviklere, lover verificerbar privatlivsbeskyttelse og udforsker partnerskaber med tredjeparter , samtidig med at de anerkender udfordringens vanskelighed: nuværende LLM-programmer snubler, når opgaver bliver komplekse, og er ikke en erstatning for veldesignede, klassiske algoritmer.

AppleLLM: Hvad vi ved, og hvorfor det kommer nu

Ifølge Bloomberg-kilder, citeret af Mark Gurman, tester Apple allerede internt en LLM integreret i sin assistent, hvor medarbejdere giver direkte feedback til teamet. Denne indsats passer ind i Project Ajax og den såkaldte AppleGPT , en metode, der ville give Siri mulighed for at evaluere forespørgsler og eskalere dem til en anden model, når kompleksiteten berettiger det.

Den køreplan, der foreslås af disse lækager, tegner to klare milepæle: en moderniseret Siri i den nuværende generation af systemer og en mere ambitiøs efterfølgende iteration. Først vil vi se en Siri, der forstår kontekst og anmodningssekvenser uden meningsløse genstarter , og som er i stand til at læse beskeder eller e-mails for at udtrække nyttige data med lokale tilladelser; derefter kommer en version, der inkorporerer sin egen LLM som samtale-rygrad.

Gurman placerer det næste store spring omkring foråret 2026, der falder sammen med en iOS 19-udgivelse, medmindre der sker ændringer i sidste øjeblik. Dette ville ikke være første gang, at Apple har vist en forhåndsvisning af en vision på WWDC og implementeret den måneder senere , som det skete med Siri, der oprindeligt blev annonceret i 2024, men udskudt til yderligere forfinelse.

Apple Intelligence Today: Arkitektur, størrelse og specialisering

Mens AppleLLM modnes, bruger virksomheden allerede Apple Intelligence som et sæt modeller, der er stærkt fokuseret på hverdagsopgaver. Der er en on-device-model med omkring 3.000 milliarder parametre og en større i skyen , der kører på Apple Silicon-servere drevet af vedvarende energi. Ideen er at håndtere de fleste anmodninger på enheden og skalere til den private sky, når arbejdsbyrden kræver det.

Til træning oplyser Apple, at de brugte AXLearn, deres open source-maskinlæringsframework, der blev lanceret i 2023, med licenserede data og offentligt indhold indsamlet af AppleBot. Virksomheden insisterer på, at de ikke bruger private brugerdata, anvender filtre til personligt identificerbare oplysninger og kasserer støj og dubletter , og tilbyder også en mekanisme for udgivere til at anmode om udelukkelse.

I optimeringen bruger den lokale model et ordforråd på 49K tokens, mens servermodellen bruger 100K, med hukommelsesreduktioner for at mindske latenstid. Tilgangen er specialistbaseret: adaptere til skrivning, opsummering, brainstorming, klassificering, lukket og åben QA, programmering, udtrækning, matematisk ræsonnement, sikkerhed og omskrivning , blandt andet.

I benchmarks udvalgt af Apple, såsom IFEval (følg instruktionerne), matcher eller overgår deres modeller konkurrenter af lignende størrelse, og de kan endda sammenlignes med GPT-4 Turbo og Mistral 8x22B på serversiden til specifikke opgaver. Alligevel erkender Apple, at deres tilgang er meget fokuseret og i øjeblikket ikke kan prale af fuld multimodalitet: der er tekst og tale, men ikke video i stil med andre tilbud i sektoren.

Privacy by Design: Forklaring af privat cloud computing

Når enheden ikke kan håndtere kravene, kommer Apples Private Cloud Compute-framework i spil. Det lover end-to-end-kryptering, kortvarig behandling og ukorrelerede tilfældige identifikatorer med ekstern revision og ingen særlige privilegier for medarbejdere.

Virksomheden forsikrer, at dataene kun bruges til det formål, som brugeren anmoder om, og at de ikke er synlige for internt personale. Derudover undgår de tredjepartskomponenter af sikkerhedsmæssige årsager og begrænser diagnostisk telemetri til meget private muligheder. Alt dette gøres ved hjælp af deres egne chips i verificerede faciliteter med offentlig vægt på verificerbarhed foretaget af forskere.

Siri: fra nuværende snublerier til den version, der sigter mod mere

Siri, der allerede er på vej frem i den nuværende generation af systemer, lover bedre at forstå kontekst og kommandosekvenser. Den vil endelig være i stand til at kæde simple anmodninger sammen uden at miste overblikket og fungere som en sand assistent for lokale personlige data : beskeder, e-mails, begivenheder, altid med brugerkontrol.

Der er dog et hul, som Apple bygger bro over: For forespørgsler, der overskrider denne ramme, vil Siri kunne aktivere ChatGPT med eksplicit tilladelse. Integrationen vil respektere samtykke hver gang, skjule IP-adressen og vil ikke kræve en ny konto ; Apple understreger, at oplevelsen kun forlader sin privatlivsparaply med brugerbekræftelse.

Døren er ikke lukket for andre aktører: Craig Federighi har holdt muligheden åben for at integrere Google Gemini eller andre udbydere i fremtiden. Dette giver fleksibilitet for markeder som Kina eller for scenarier, hvor ChatGPT ikke er tilgængelig , uden at opgive deres egen model på mellemlang sigt.

WWDC og åbning: Apple vil ikke klare sig alene med AI

Forud for WWDC forbereder Apple et vigtigt skridt: at åbne sin AI som en tværfunktionel platform for økosystemet. Et værktøjssæt, der tidligere var forbeholdt interne teams, vil blive stillet til rådighed for udviklere , hvilket giver dem adgang til letvægtsmodeller, der kan køre lokalt, samtidig med at privatlivets fred respekteres.

Parallellen til App Store er tydelig: Da tredjeparter kunne skabe oplevelser, slog iPhone igennem som platform. Målet er nu at forhindre udviklere i at migrere til tredjepartsmodeller og at gøre det lettere for dem at bygge native, intelligente oplevelser ved hjælp af Apples Foundation Models, herunder gratis inferens og offline-muligheder.

Blandt målene er at hæve barren for at matche konkurrenterne, lære af reel feedback og accelerere produktudviklingen. De overvejer endda at bruge tredjepartsmodeller som Claude til en Swift-assistent , hvilket understreger Apples vilje til at være pragmatisk i sit udviklerværktøjssæt.

Funktioner kommer snart: fra Live Translation til Visuel Intelligens

Apple Intelligence er ikke bare hype: det gør sig allerede gældende i konkrete funktioner på iOS, iPadOS og macOS. Live Translation muliggør oversættelse i realtid under tale- og videoopkald og integrerer med Beskeder, FaceTime og Telefon, alt sammen understøttet af lokale modeller.

Image Playground bevæger sig fremad med sin udvikler-API og tilladelsesbaserede ChatGPT-integration, mens Genmoji giver brugerne mulighed for at oprette kombinationer og beskrivelser for mere nuancerede udtryk . Magic Wand-værktøjet forvandler skitser til billeder med blot et par tryk.

I produktivitetstilstand registrerer Påmindelser relevante handlinger, når du læser en e-mail eller note, og sorterer dem automatisk efter kategori . Beskeder foreslår oprettelse af afstemninger, når det er relevant , Mail tilføjer forbedret forhåndsvisning, og Fokustilstand forfiner håndteringen af ​​afbrydelser.

Den inkluderer også prioriterede notifikationer, søgning i naturligt sprog og muligheden for at oprette mindevideoer i Fotos med en simpel beskrivelse. På Apple Watch bruger Workout Buddy puls, tempo, distance, ringe og milepæle til personlig motivation i realtid; først på engelsk og til træning som løbebånd eller stationær cykel.

Visuel intelligens tilføjer kontekstuelle superkræfter til skærmen: indfang et produkt, du kan lide, og bestil lignende produkter med priser og funktioner; lav en koncertplakat om til en kalenderbegivenhed med et enkelt tryk ; eller udtræk øjeblikkeligt data fra et spillested med et tryk på kameraet eller handlingsknappen.

Fundamenter for skabere: Fundamentsmodeller og vejen til skalering

For udviklere vil Foundation Models være den officielle indgang til at integrere Apples modeller i tredjepartsapps. Det tilbyder fortrinsret til de samme LLM'er, der bruges af Apple Intelligence, indbygget privatlivsbeskyttelse og offline-udførelse, hvor det er muligt, med AI-inferens uden driftsomkostninger.

Strategien er overbevisende på to fronter: ved at tilbyde native, proprietære funktioner frem for eksterne alternativer, og ved at udvide rækkevidden af ​​Apple Intelligence gennem økosystemets opfindsomhed . Betaversionen af ​​Apple Developer Program er allerede i gang, med en offentlig betaversion efterfølgende og en udrulning til kompatible enheder i efteråret.

Alvorlig kritik af LLM-paradigmet: kompleksitetens mur

Udover produktfortællingen har Apple offentliggjort forskning, der vækker debatten: Når man kvantificerer ræsonnementsevner, observeres det, at LLM'er kollapser ud over en vis kompleksitetstærskel , selv når der er rigelige computerressourcer.

Denne kritik stemmer overens med tidligere arbejde af flere medforfattere siden 2023: pålidelige agenter kan ikke bygges uden tilstrækkeligt udviklet formel og abstrakt ræsonnement. Ifølge disse analyser ræsonnerer storskalamodeller ikke som mennesker; de kan tænke mere ... men kun op til et vist punkt.

Hanoi-tårnet er det primære eksempel. Det er et klassisk problem, der er trivielt for en algoritme og muligt for et tålmodigt barn, men moderne modeller som Claude sidder fast med 7 diske og fejler praktisk talt med 8. Selv nyere varianter, såsom o3-min i high-fit, forbedres ikke væsentligt i disse tests.

Endnu mere chokerende: Selv når modellerne får en trin-for-trin algoritme til at løse opgaven, har de en tendens til at præstere dårligt . En medforfatter, Iman Mirzadeh, påpeger, at det observerede ikke ligner en logisk proces eller en form for intelligens, da udførelse ikke er det samme som forståelse.

Værket genbesøger og forstærker også Subbarao Kambhampati's kritik af tankekæder og såkaldte ræsonnementmodeller. CoT'er afspejler nogle gange ikke, hvad modellen rent faktisk gør, og når de synes korrekte, er det endelige svar måske ikke . Inferens-time-beregningsteknikken sættes også spørgsmålstegn ved som en strukturel genvej.

Den operationelle konklusion er barsk: LLM'er har en tendens til at overtænke simple ting og forsøge forkerte svar, selv efter at have fundet det rigtige, og undertænke vanskelige ting , hvilket spilder beregninger på den ene side og giver op for tidligt på den anden.

Generalisering og gamle erfaringer: intern og ekstern distribution

Denne argumentation stemmer overens med langvarig kritik af neurale netværk: de generaliserer acceptabelt inden for træningsdistributionen, men kollapser uden for den . En af medforfatterne dokumenterede allerede dette i 1998 med flerlagsperceptroner til sætningsberegning og forudsigelse.

Den tråd blev udvidet i The Algebraic Mind i 2001, i en artikel i Science fra 1999, hvor det blev bevist, at syv måneder gamle babyer ekstrapolerer mønstre, som datidens netværk ikke replikerede , i Deep Learning: Critical Appraisal i 2018 og i Deep Learning is Hitting a Wall i 2022. En bane, der nu bekræftes med nye data.

Det er også anerkendt, at almindelige mennesker fejler med otte disketter i Hanoi-tårnet. Men det er netop pointen: Vi opfandt computere til pålideligt at løse de problemer, vi kæmper med . Ambitionen hos en fornuftig AGI ville være at kombinere menneskelig tilpasningsevne med maskiners pålidelighed, ikke at arve det værste fra begge verdener.

Den praktiske dom: LLM'er erstatter ikke gode, konventionelle algoritmer . De spiller ikke skak som klassiske algoritmer, de folder heller ikke proteiner som specialiserede neurosymbolske systemer, og de administrerer heller ikke databaser som konstruerede algoritmer. De er nyttige til at skrive kode ... men kun periodisk.

Apples vision: færre hallucinationer og ansvar

I briefinger forsvarede John Giannandrea og Craig Federighi Apples tilgang til at minimere hallucinationer, som er baseret på kuraterede data og støttehjul. De udtalte, at de har fokuseret på omhyggelig træning og ansvarlig teknologianvendelse med det formål at finde modeller, der er mere effektive og mindre skadelige end alternativer, baseret på intern testning.

Med hensyn til samarbejdet med OpenAI, indrammer Apple det som kontrolleret adgang til tredjeparter, når brugeren anmoder om det. Dette sker altid med tilladelse, med en skjult IP-adresse og uden at udbyderen gemmer anmodninger, hvilket garanterer så meget replikering af Private Cloud Computing som muligt.

Rygter, interne spændinger og strategi

Gurmans rapporter tegner et billede af intern friktion mellem software- og AI-ledere og en mere konservativ end ønskelig investering i GPU'er. Der er rapporter om nedskaleret hardwareordrer og modeller for 3 milliarder dollars on-premises og titusindvis af milliarder i skyen , stadig langt fra den banebrydende skala, som andre aktører udforsker.

Den strategiske konklusion er, at Apple går forsigtigt frem og prioriterer privatliv og kontrol over brugeroplevelsen, samtidig med at de er afhængige af selektive partnerskaber for at udfylde huller. Nogle fortolker integrationen af ​​ChatGPT som en midlertidig foranstaltning, andre som et pragmatisk springbræt til en mere kapabel proprietær model.

På markedet er presset reelt: mindre stigende iPhone-salg og hurtig konkurrence. Apple opretholder en massiv installeret base og misundelsesværdig hardware-software-integration ; hvis de accelererer deres AI-indsats, kan de forvandle denne base til en fornyet konkurrencefordel.

Hvad det betyder for virksomheder og udviklere

Moralen i historien for de, der bygger løsninger, er klar: det er ikke nok blot at forbinde en generel model og forvente robusthed. LLM'er har begrænsninger og erstatter ikke algoritmer, der er afprøvet i kritiske opgaver . De kan dog approksimere, accelerere prototyping, brainstorming og skrivning, især når de kombineres med eksterne symbolske blokke.

Med Foundation Models og udførelse på enheder tilbyder Apple en interessant måde at orkestrere private og kontekstuelle oplevelser på sin platform. Kombineret med Private Cloud Compute og valgfri tredjepartsintegration åbner dette op for muligheder for at skabe vertikale assistenter, kontekstuelle arbejdsgange og generative brugergrænseflader inden for betroede frameworks.

For organisationer ville retningslinjen være at kombinere det bedste fra begge verdener: konventionelle algoritmer, hvor nøjagtighed er altafgørende, og specialiserede LLM'er, hvor fleksibilitet er nøglen . Og at overvåge grænserne for ræsonnement, verifikation og sporbarhed nøje, især inden for regulerede områder.

Med al denne kontekst fremstår AppleLLM ikke som en simpel boks at sætte kryds i, men som den brik, der kan lukke cirklen mellem en virkelig kompetent Siri, en tværgående AI-platform og en verificerbar privatlivsstrategi. Hvis Apple udfører det med sin karakteristiske stringens, kan deres egen model være det skub, der er nødvendigt for, at deres økosystem kan tage det kvalitative spring, der har undgået dem indtil nu.

Sådan finder du ud af, hvad Siri kan gøre på din iPhone 4
relateret artikel:
Komplet guide: Opdag alt, hvad Siri kan gøre på din iPhone

Tilføj som foretrukken kilde i Google