Skjoldemose.AI
ArtiklerReposBaggrund

Skjoldemose.AI

Navigation

ArtiklerReposBaggrund

Nyhedsbrev

Trending Open Source, en gang om måneden.

Kontakt

skjoldemosejohansen@gmail.comLinkedInYouTube

© 2026 Skjoldemose.AI. Alle rettigheder forbeholdes.

←Open Source
1. juli 20269 min

Crawlee: Lær din computer at samle data fra nettet

DataAutomatiseringOpen Source

Overblik

Hvad er det

Et værktøj til at bygge små robotter, der automatisk henter data fra hjemmesider


Udbredelse

24.200+ stjerner på GitHub, 1.500+ forks


Relevant for

Alle der skal samle data fra mange websider, fx priser, opslag eller artikler. Lidt programmering hjælper, men et værktøj som Claude Code kan skrive det meste.


Sværhedsgrad

4/10

Du skal kunne køre en kommando i en terminal og rette en lille smule kode. De svære dele klarer Crawlee selv.

Licens: Apache 2.0

Kommerciel brugJa
Lavet afApify
SprogNode.js (også Python)
PrisGratis

Apache 2.0 er en af de mest åbne licenser, der findes. Du kan frit bruge Crawlee, også kommercielt, og du er ikke bundet til firmaet bag.

Forestil dig, at du skal hente priserne fra tusind produktsider. Eller titlerne på alle artikler i et stort arkiv. I hånden er det timevis af copy-paste, og du laver fejl undervejs. Den slags er en computer langt bedre til end dig.

Crawlee er et gratis værktøj, der bygger små robotter, som gør netop det. Du fortæller robotten, hvilke sider den skal besøge, og hvad den skal hente. Så klikker den sig rundt og samler data, mens du laver noget andet.

Hvad det egentlig er

En robot, der kravler rundt på nettet

At hente data fra hjemmesider automatisk kaldes web scraping. Robotten, der gør det, kaldes en crawler, fordi den kravler fra side til side via links, ligesom du selv ville klikke dig videre.

En crawler gør i bund og grund to ting: den henter indholdet af en side, og den finder links til de næste sider, den skal besøge. Gentag det nok gange, og den har været hele vejen igennem et website og samlet det op, du bad om.

Hvad Crawlee gør

Den tager det svære fra dig

Idéen lyder simpel, og i princippet er den det også. Det svære er alt det rundt om, og det er her, Crawlee tjener sit værd:

Den holder styr på listen

Robotten skal huske, hvilke sider den allerede har set, og hvilke der mangler. Crawlee fører den liste for dig, også hvis robotten stopper midt i det hele og skal starte igen.

Den kan åbne svære sider

Nogle sider viser først deres indhold, når en rigtig browser åbner dem. Crawlee kan styre en browser i baggrunden, uden vindue, så robotten ser præcis det samme som dig.

Den finder selv tempoet

Går robotten for hurtigt, bliver den blokeret. Går den for langsomt, tager det evigheder. Crawlee tilpasser selv farten efter din computer.

Den snedige del

Kunsten ikke at blive smidt ud

Mange hjemmesider prøver at blokere automatiske besøg. De kigger efter spor, der afslører, at gæsten er en robot og ikke et menneske: hvordan browseren opfører sig, hvor hurtigt der bliver klikket, og hvor besøget kommer fra.

Crawlee er bygget til at få robotten til at ligne en ganske almindelig besøgende. Den efterligner en rigtig browsers spor og kan skifte mellem flere internetforbindelser, så det ikke ser ud, som om alt strømmer fra ét sted. Robotten får derfor oftere lov at blive og gøre sit arbejde færdigt.

Det svære ved web scraping er sjældent at hente en side. Det er at hente ti tusind uden at blive blokeret undervejs.

Sådan prøvede jeg det

To kommandoer, så kører den

Du kommer i gang uden at bygge noget fra bunden. Crawlee laver et helt færdigt projekt for dig, som du bare kan starte:

# Lav et færdigt projekt
npx crawlee create min-crawler

# Gå ind i mappen og start robotten
cd min-crawler
npm start

Selv brugte jeg det til at samle data til mit VM-hold på Holdet.dk, hvor man sætter et hold sammen inden for et budget. I stedet for at kopiere spillernes tal fra side efter side lod jeg en lille crawler hente dem og samle dem i én fil, klar til at vælge ud fra. En anden crawler hentede indlæg fra spillets blog, side for side, uden at tage det samme med to gange.

Men her kommer den ærlige del. Jeg bruger Claude Code til det meste af det her, og det svære var slet ikke at hente dataene. Det svære var at finde ud af, hvor de lå. Holdet.dk var skiftet til en ny platform, så den gamle datakilde var død, og Claude Code måtte grave rundt med helt almindelige værktøjer for at finde den nye og forstå, hvordan den var skruet sammen.

Den ærlige vurdering

Hvornår Crawlee virkelig betaler sig

Da jeg først havde fundet datakilden, var selve hentningen nærmest ingenting. Et par linjer kode ville have gjort det samme, så til lige præcis det kald var Crawlee ærligt talt lidt overkill.

Crawlee betaler sig et andet sted: i alt det, der sker, når man kører det igen og igen. Jeg henter jo nye tal hver runde. Datakilden fejler af og til midt under en kamp, og der prøver Crawlee bare igen i stedet for at give op. Den holder et roligt, høfligt tempo, så jeg ikke bliver blokeret. Og til bloggen, hvor der ikke var nogen pæn datakilde, er Crawlee i sit es: den læser siderne, følger med videre til næste side, og undgår at tage det samme med to gange.

Havde Holdet.dk ikke haft en datakilde bagom, ville Crawlee have været helten. Siden viser nemlig først sine tal, når en rigtig browser kører den, og så skal man styre en browser og læse tallene ud af selve siden. Det kan Crawlee, og der er den svær at undvære. Vi slap for det, fordi kilden fandtes bagom.

Hvor det virkelig rykker

En større sag: konkurrenternes priser

Min egen brug var lille og privat. Skru op for det, og værktøjet tjener rigtige penge. Tag en webshop, der konkurrerer på pris: med Crawlee kan man have en robot, der hver time tjekker tusindvis af konkurrenters produktsider og henter priserne, så man kan justere sine egne automatisk.

Jeg har ikke selv bygget sådan et prissystem, men det er dér, den slags for alvor betaler sig.

Bundlinje

Claude Code finder dataen, Crawlee henter den

Så min konklusion er egentlig ret enkel. Det svære, altså at finde og forstå datakilden, det var Claude Codes arbejde. Crawlee er rørføringen ovenpå, der bare henter dataene igen og igen uden at brokke sig. Til et enkelt kald er det lidt for meget værktøj. Til noget, der skal køre uge efter uge, er det lige det, man skal bruge.

Bruger du allerede Claude Code, er det en god arbejdsdeling: lad Claude Code finde dataene, og lad Crawlee stå for at hente dem stabilt bagefter.

Læs mere

GitHub: apify/crawlee

24.200+ stjerner · Apache 2.0 · Gratis

→

crawlee.dev

Dokumentation og eksempler

→

Nyhedsbrev

Jeg sender en lignende gennemgang af et Open Source-projekt ca. en gang om måneden.