Modele rozumienia wideo TwelveLabs są już dostępne w Amazon Bedrock

AWS dodaje do Amazon Bedrock natywne embeddingi wideo oraz modele rozumienia wideo. Otwiera to mnóstwo potencjalnych zastosowań, do których wcześniej sięgałem po modele Gemini. Przykładem takiego zastosowania jest system edukacyjny, który obserwuje, jak uczeń wykonuje zadanie, i udziela informacji zwrotnej na podstawie materiałów szkoleniowych.

Bedrock miał już workflow do rozumienia wideo, ale to było dokładnie to: workflow, żadne natywne modele. Możecie sobie wyobrazić, jak to wyglądało—weź wideo, potnij na klatki, wrzuć klatki do VLM, spróbuj utrzymać spójność czasową, popadnij w rozpacz, pogódź się z wydajnością systemu i jedź na urlop.

Teraz jednak mamy nie jeden, a dwa różne natywne modele wideo:

  1. TwelveLabs Marengo, do tworzenia embeddingów wideo;
  2. TwelveLabs Pegasus, do generowania tekstu na podstawie wideo.

Cennik modeli zależy od tego, czy wideo ma ścieżkę audio, ale trzeba się liczyć z $2.5-$3 za godzinę wideo w przypadku Marengo i $1.8 za godzinę w przypadku Pegasusa.