Multimodális alkalmazások · Lecke 01

Mi a multimodalitás

Egy AI modell, amely nem csak szöveget ért, hanem képet is. Ez a lecke bemutatja, mit jelent ez pontosan, és milyen új alkalmazási lehetőségeket nyit meg.

Vissza a tananyaghoz


Egy modell, két bemeneti forma

A Claude modellcsalád úgynevezett vision képességgel rendelkezik, ami azt jelenti, hogy a szöveges kérés mellett képeket is tud fogadni és értelmezni ugyanabban a kérésben. Nem egy külön "kép felismerő" modulról van szó, hanem magának a modellnek a részéről, amely a képet és a szöveget együtt, egy közös értelmezési keretben dolgozza fel. Ez teszi lehetővé, hogy a modell ne csak leírja, mit lát egy képen, hanem összefüggésbe is hozza azt a mellékelt szöveges kérdéssel vagy dokumentummal.


Kép JPEG, PNG, GIF, WebP Szöveg Claude együttes értelmezés Válasz szövegben
A kép és a szöveg egyetlen közös kérésben, együtt kerül a modellhez.

Külön kép felismerő modul

A kép egy elkülönült rendszerbe kerül, amely csak címkéket vagy nyers szöveget ad vissza. A kép és a kérdés soha nem találkozik.

Beépített vision képesség

A kép a modell saját értelmezési keretébe kerül, így Claude a képet a mellékelt kérdéssel és dokumentummal összefüggésben érti meg.


Mire jó ez a gyakorlatban

A multimodális képesség sokféle üzleti feladatot old meg, amit korábban külön eszközzel vagy emberi munkával kellett elvégezni. Ilyen például egy dokumentum vagy számla lefotózása és tartalmának kinyerése, egy termékfotó leírása vagy kategorizálása, egy diagram vagy táblázat értelmezése, esetleg egy hibaüzenetről készült képernyőkép elemzése. A közös pont mindegyikben, hogy a felhasználó nem szöveget ír le a képről, hanem magát a képet küldi el, és a modell abból dolgozik.


Számla, dokumentum fotó Termékfotó Diagram, táblázat Hibaüzenet képernyőkép Claude a képből dolgozik Kinyert adat, leírás, elemzés
Négy tipikus üzleti feladat, amelynél a felhasználó magát a képet küldi el, nem annak leírását.

  1. Lefotózod vagy elmented a képetSzámla, termékfotó, diagram vagy képernyőkép, ahogy éppen van.
  2. Elküldöd a kérdéssel együttNem írod le szöveggel a kép tartalmát, magát a képet mellékeled a kéréshez.
  3. A modell a képből dolgozikClaude a képet és a kérdést együtt értelmezi, és szövegben válaszol.

Mit NEM tud Claude

Fontos tisztázni már itt az elején, hogy Claude képeket megérteni tud, de generálni vagy szerkeszteni nem. Ha valaki képet szeretne létrehozni vagy módosítani, ahhoz más típusú, kifejezetten képgenerálásra épített eszközre van szükség. Claude ereje az elemzésben, leírásban és a képekhez kapcsolódó gondolkodásban van, nem a képek előállításában.


4

Ennyi képformátumot fogad Claude a vision képességgel. JPEG, PNG, GIF és WebP, tehát a leggyakoribb üzleti formátumok mind mehetnek.


Kép megértése leírás, elemzés, adatkinyerés igen Kép generálása új kép létrehozása vagy szerkesztése nem
Claude a képek megértésében erős, a képek létrehozása más típusú eszköz feladata.

Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →