LLaVA: Large Language and Vision Assistant
OPEN-SOURCE AND FREE „CHATGPT VISION”
GitHub: https://github.com/haotian-liu/LLaVA
Dall-E 3″ „pole wulkanicznej lawy a w oddali wulkan podczas erupcji”




OPEN-SOURCE AND FREE „CHATGPT VISION”
GitHub: https://github.com/haotian-liu/LLaVA
Dall-E 3″ „pole wulkanicznej lawy a w oddali wulkan podczas erupcji”




Jeżeli traktujemy ChatGPT jako asystenta, najczęściej wyróżnia się rolę, zadanie i format jako podstawowe elementy budowy prompta. Domyślna rola ChatGPT to „pomocny asystent”, o czym można się przekonać w Playgroundzie. Jest uniwersalna, ale warto ją precyzować. Naszemu asystentowi należy następnie przypisać zadanie, i aby pomóc mu być bardziej konkretnym, warto zawrzeć kontekst i szczegóły. Do…
„Grounding” pomaga modelom uczenia maszynowego odnosić się do przykładów z rzeczywistego świata. Włączenie „groundingu” sprawia, że modele są bardziej wydajne pod względem dokładności i odporności podczas wnioskowania. Pomaga to także zmniejszyć tzw. „halucynacje” w modelach językowych. online demo hosted by HuggingFace https://huggingface.co/spaces/ydshieh/Kosmos-2 Repozytorium https://github.com/microsoft/unilm/tree/master/kosmos-2 #MLLM #Kosmos #Microsoft GPT-4: KOSMOS-2 to Wielomodalny Duży Model Językowy (MLLM)…
Kilka, a konkretnie 7, przydatnych podpowiedzi związanych z komendą sudo znajdziecie w krótkim artykule i poradniku dla użytkowników Linuksa (link na końcu). Znasz sudo, prawda? Musiałeś go kiedyś użyć. Dla większości użytkowników Linuksa jest to magiczne narzędzie, które daje możliwość uruchomienia dowolnego polecenia jako root lub przełączenia się na użytkownika root. Ale to tylko półprawda….
What is GPT-4V? GPT-4V(ision) (GPT-4V) is a multimodal model developed by OpenAI. GPT-4V allows a user to upload an image as an input and ask a question about the image, a task type known as visual question answering (VQA). GPT-4V is rolling out as of September 24th and will be available in both the OpenAI…
Oto kilka galerii obrazów wygenerowanych przez Dall-E 3 via Bing. Teksty także stworzone za pomocą sztucznej inteligencji. Obrazy bez selekcji. Teksty bez poprawek. Zobaczcie do czego dziś zdolna jest AI. Ale ma początek true story… 😉 JA: Dall-E, wygeneruj mi kobietę z dużym biustem. AI: Foch, nie, użyłeś słowa „biust” i wykryto niebezpieczną zawartość. JA:…
Gemini to architektura uczenia maszynowego opracowana przez Google AI. Jest to architektura transformatorowa, która jest bardziej wydajna niż inne architektury, takie jak LaMDA. Umożliwia to Gemini przetwarzanie większej ilości danych w krótszym czasie. Dzięki temu Gemini może być używany do bardziej złożonych zadań uczenia maszynowego, takich jak rozpoznawanie obrazów i tłumaczenie języków naturalnych. Gemini składa…