FlyweightBot: nasz robot indeksujący
FlyweightBot to robot internetowy firmy Flyweight GmbH. Odczytuje publiczne strony sklepów, których właściciele zainstalowali naszego asystenta zakupowego AI. Dzięki temu asystent odpowiada na podstawie produktów, zasad i treści pomocy sklepu.
Jeśli trafiliście tutaj z logów dostępu, poniżej znajdziecie informacje o rozpoznawaniu, dopuszczaniu i blokowaniu robota.
Dlaczego odwiedza Waszą stronę
Skanujemy domenę dopiero po zainstalowaniu Flyweight w sklepie i podłączeniu domeny jako źródła treści. Nie przeszukujemy otwartej sieci ani nie podążamy za linkami poza podłączoną domeną.
Skanowanie odbywa się przy pierwszym podłączeniu oraz aktualizacji treści, a nie bez przerwy. Jeśli nie spodziewaliście się wizyty, ktoś z Waszego zespołu mógł zainstalować aplikację ze Shopify App Store.
Jak go rozpoznać
Każde żądanie zawiera ten identyfikator na końcu nagłówka User-Agent:
FlyweightBot/1.0 (+https://flyweight.io/bot)
Robot używa prawdziwej przeglądarki Chrome i wyświetla strony tak, jak widzi je klient. Pełny przykład:
Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) HeadlessChrome/143.0.0.0 Safari/537.36 FlyweightBot/1.0 (+https://flyweight.io/bot)
Wersja Chrome zmienia się wraz z aktualizacjami. Dopasowujcie ciąg FlyweightBot, nie cały nagłówek ani konkretną wersję Chrome.
Skąd pochodzą żądania
Ruch robota wychodzi obecnie przez jeden stały adres IP przeznaczony wyłącznie dla nas:
52.212.232.38
Adres IP jest dokładniejszym kryterium listy dozwolonych adresów. Identyfikator rozpoznaje robota także po dodaniu kolejnej drogi dostępu. Jeśli narzędzie przyjmuje tylko User Agent, użyjcie FlyweightBot, pamiętając o opisanej poniżej możliwości podszywania się.
Jak zezwolić na dostęp
W Cloudflare utwórzcie niestandardową regułę WAF z akcją Skip. Aby sprawdzić IP:
(ip.src eq 52.212.232.38)
Aby sprawdzić jednocześnie User Agent i IP:
(http.user_agent contains "FlyweightBot" and ip.src eq 52.212.232.38)
Każdy może skopiować FlyweightBot do nagłówka User-Agent. Reguły opartej tylko na nim używajcie wyłącznie wtedy, gdy nie ma dokładniejszej opcji. Wybierajcie ograniczony wyjątek zamiast ogólnego Skip:
(http.user_agent contains "FlyweightBot")
Inne WAF i CDN oferują podobne reguły. W nginx reguła musi korzystać z klasyfikacji, aby ta zadziałała:
map $http_user_agent $blocked_bot {
default 0;
"~*(bot|crawler)" 1;
"~*FlyweightBot" 0;
}
server {
if ($blocked_bot) {
return 403;
}
}
Aplikacje Shopify chroniące przed oszustwami lub blokujące kraje i boty często mają listę dozwolonych adresów. Dodajcie powyższy IP albo FlyweightBot, jeśli pole oczekuje User Agent. Blokada może sprawić, że asystent będzie korzystał z niepełnych lub nieaktualnych treści.
Jak zatrzymać skanowanie
Robot obecnie nie odczytuje robots.txt, więc reguła w tym pliku go nie zatrzyma. Usuńcie domenę ze źródeł treści w panelu Flyweight lub odinstalujcie aplikację, aby nie planowano kolejnych skanowań. Trwające skanowanie dokończy bieżącą partię stron, zwykle w ciągu kilku minut.
Możecie też blokować żądania w WAF lub CDN, używając powyższych wyrażeń z akcją blokowania. Jeśli to możliwe, najpierw skontaktujcie się z nami: blokada uniemożliwia asystentowi odświeżanie wiedzy o Waszym sklepie.
Kontakt
Pytania o robota lub prośby o zatrzymanie skanowania domeny, którą zarządzacie: hello@flyweight.io. Odpowiadamy bezpośrednio.
Flyweight GmbH, Jungbuschstraße 28, 68159 Mannheim, Niemcy. Informacje prawne.