Microsoft MarkItDown för nybörjare: gör en PDF till granskad Markdown för AI

Den råa Markdown-filen såg nästan klar ut. Alla sex källuppgifter fanns där, men det gjorde också en dubblerad titel, ett webbläsarhuvud, en lokal filsökväg, sidnummer och ett sidbrytningstecken. Först efter jämförelsen med PDF-filen tog vi bort bruset och återställde enkel Markdown-struktur i en separat kopia.

Det är arbetsflödet i den här guiden: PDF → rå Markdown → källkontroll → granskad Markdown. Originalet och råfilen ligger kvar hela vägen.

Vem guiden är för

Guiden passar dig som får ett underlag, en instruktion eller en rapport som PDF och vill ha en transparent textfil innan innehållet går vidare till sammanfattning, sök eller ett annat AI-arbetsflöde.

Vi använder ett fiktivt, tvåsidigt underlag för en AI-pilot. Texten i filen går att markera. Det är viktigt: den vanliga PDF-vägen i den här guiden är inte OCR för skannade sidor.

Det här har du när du är klar

Du kommer att ha:

  • Originalets PDF-fil, oförändrad;
  • En orörd råfil från konverteringen;
  • Sex källuppgifter som har jämförts med PDF-filen;
  • En separat granskad Markdown-fil;
  • Ett kort konverteringskvitto.

Vad Microsoft MarkItDown är

Microsoft MarkItDown är ett öppet Python-verktyg som konverterar filer till Markdown för språkmodeller och annan textanalys. Markdown är vanlig text med enkel struktur för exempelvis rubriker och listor.

Microsoft skriver också att resultatet är gjort för textanalys, inte för trogen återgivning av dokumentets visuella layout. Se därför konverteringen som ett mellanformat som går att granska, inte som en perfekt kopia.

Källa: Microsoft MarkItDown README.

Vid publiceringen var MarkItDown 0.1.7 den aktuella versionen på PyPI. Paketet kräver Python 3.10 eller senare och har ett separat tillägg för PDF-stöd.

Källa: MarkItDown på PyPI.

Innan du börjar: välj en PDF med text som går att markera

Lägg PDF-filen i en egen arbetsmapp och kontrollera att du kan markera och kopiera text ur den. Skriv sedan ned sex uppgifter som måste finnas kvar efter konverteringen. I vårt test var de:

  1. Titel;
  2. Datum;
  3. Ägare;
  4. Hela målmeningen;
  5. Stoppregeln;
  6. Hela meningen som beskriver godkänt resultat.

Använd en fil som du får behandla och behåll originalet oförändrat. En egen mapp gör arbetsflödet tydligare, men den är ingen teknisk sandbox. MarkItDown använder processens vanliga fil- och nätverksrättigheter.

Steg 1: installera PDF-stödet

Kommandona nedan är den väg vi testade i en terminal på Linux eller macOS. Skapa först en isolerad Python-miljö:

python3 -m venv .venv
source .venv/bin/activate
python -m pip install 'markitdown[pdf]'
markitdown --version

Det PDF-specifika tillägget installerar bara beroendena som behövs för den här filtypen. Guiden använder inte paketets bredare all-installation, Azure-tjänster eller OCR-tillägg.

Steg 2: skapa en orörd råfil

Kör konverteringen med en tydlig utdatafil:

markitdown underlag-for-ai-pilot.pdf -o underlag-for-ai-pilot-raw.md

-o anger var resultatet ska sparas. Ordet raw visar att filen kommer direkt från konverteraren och ännu inte är godkänd. Ändra inte den filen innan du har jämfört den med originalet.

I vårt test använde MarkItDown PDF-filens befintliga textlager. Den inbyggda PDF-konverteraren bygger på pdfplumber och pdfminer.six, så en skannad bildsida behöver en separat OCR-väg.

Källa: MarkItDown PDF converter.

Steg 3: jämför källuppgifterna före rensning

Öppna PDF-filen och den råa Markdown-filen sida vid sida. Använd den här granskningskortet:

PDF → Markdown-kontroll
[ ] Titeln finns i den granskade filen
[ ] Datum och ägare stämmer med PDF-filen
[ ] Målmeningen är komplett
[ ] Stoppregeln är oförändrad
[ ] Meningen för godkänt resultat är komplett
[ ] Läsordningen fungerar fortfarande
[ ] Sidhuvuden, sidfötter, sidnummer och filvägar är markerade som brus
[ ] Saknad, dubblerad eller osäker text är noterad

Kontrollen som kördes på publiceringsdagen läste tillbaka textlagret ur PDF-filen med pdftotext, jämförde sex fördefinierade källuppgifter med både råfil och granskad fil och bekräftade samma ordning i alla tre. Kontrollen säger inget om resten av världens PDF-filer. Den visar bara vad som hände i det här avgränsade testet.

Steg 4: skapa en separat granskad kopia

Kopiera råfilen till ett nytt namn:

cp underlag-for-ai-pilot-raw.md underlag-for-ai-pilot-reviewed.md

I testfilen tog vi bort den dubblerade titeln, webbläsarens datumrad, den lokala file:///-raden, sidräknarna och sidbrytningstecknet. Vi återställde också enkel Markdown-struktur för rubriker och listor utan att skriva om dokumentets sakuppgifter.

Andra PDF-filer får andra fel. Ta bara bort sådant som du har jämfört med originalet. Om ett stycke saknas eller läsordningen är oklar ska det stå som en öppen fråga i kvittot, inte döljas med en snabb omskrivning.

Steg 5: spara ett konverteringskvitto

Kvittot behöver inte vara avancerat:

Indata: underlag-for-ai-pilot.pdf
Sidor: 2
Kontrollerade källankare: titel, datum, ägare, mål, stoppregel, godkänt resultat
Råfil sparad: ja
Konverteringsbrus granskat: ja
Granskad fil: underlag-for-ai-pilot-reviewed.md
Öppna frågor: inga i detta test

Spara gärna även versionsnummer och granskningsdatum. Då går det att förstå hur filen skapades om den används igen senare.

Vanliga misstag vid PDF till Markdown

  • Kommandot lyckas, så råfilen behandlas som godkänd.
  • En skannad PDF används trots att arbetsflödet saknar OCR.
  • Dubblerad text raderas innan källuppgifterna har skyddats.
  • Rå Markdown skickas vidare utan kontroll av läsordning, bortfall och rester från sidlayouten.

Nästa steg för den granskade filen

Den granskade Markdown-filen kan nu bli ett tydligt underlag för sammanfattning, sök, en kunskapsbank eller ett kontrollerat agentflöde. Behåll sökvägen till originalet och granskningsdatumet tillsammans med filen.

Om samma dokumentflöde återkommer kan Hammer hjälpa er att bygga en styrd lösning med avgränsade åtkomsträttigheter, granskningssteg och körloggar. Läs mer om Verktygssmide.

Vanliga frågor

Kan Microsoft MarkItDown läsa en skannad PDF?

Arbetsflödet i guiden förutsätter att PDF-filen redan innehåller text som går att markera. Skannade eller bildbaserade sidor behöver en separat OCR-lösning.

Är Markdown-filen färdig när kommandot lyckas?

Nej. Jämför resultatet med PDF-filen och kontrollera källuppgifter, läsordning, saknad eller dubblerad text samt sidhuvuden, sidnummer och andra konverteringsrester.

Körs PDF-konverteringen lokalt?

Ja, i det testade arbetsflödet körs MarkItDown lokalt och PDF-filen skickas inte till en molntjänst. Processen behåller dock sina vanliga fil- och nätverksrättigheter.

Smedjans nyhetsbrev

Få nya artiklar i inkorgen

Välj de ämnen som intresserar dig. Inget brus, max ett mejl i veckan.

Få nya artiklar i inkorgen

Vi följer GDPR. Avsluta när du vill.