Scout: URGENTNI: Portal NextReality.cz selhava. URL: https://www.ne

Vygenerovano: 2026-03-23 01:00 | Typ: scout | CzechAI

Model: qwen3:32b

Ukol: URGENTNI: Portal NextReality.cz selhava. URL: https://www.nextreality.cz Chyba: nonprotected_bad_scan Posledni uspech: unknown 1. Crawlni URL 2. Zmenila se struktura? 3. Anti-bot opatreni? 4. Existuje API? 5. Navrhni opravu.

Cas: 2026-03-23T00:54:28.703Z - 2026-03-23T01:00:28.812Z

PortalKat.ObtiznostRenderAnti-botDataStrategiePoznamky
NextReality.czproblematichardjavascriptcloudflarenone (only cookie banner shown)playwright with residential proxy and CAPTCHA solvingAnti-bot measures (Cloudflare bot detection cookies rc::e, rc::h). No API found. Error 'nonprotected_bad_scan' likely triggered by bot detection. JS rendering required but site may block headless browsers.

Shrnuti

**Návrh opravy pro NextReality.cz:**

1. **Anti-bot opatření**  
   - Detekováno: Cloudflare (cookies `rc::e`, `rc::h`)  
   - **Řešení**:  
     - Použijte **Playwright** s **residenčním proxy** (např. BrightData, Oxylabs) k emulaci reálného uživatele.  
     - Nastavte hlavičky (User-Agent, Accept-Language) odpovídající reálnému prohlížeči.  
     - Přidejte náhodné prodlevy mezi požadavky (2-5 sekund) pro imitaci lidského chování.

2. **JavaScript rendering**  
   - Obsah je pravděpodobně načítán dynamicky (žádné datové struktury v počátečním HTML).  
   - **Nástroj**:  
     - Použijte **Playwright** nebo **Selenium** s možností čekání na XPATH/selector (např. `await page.waitForSelector('.listing-item')`).

3. **Chyba `nonprotected_bad_scan`**  
   - Příčina: Detekce botové aktivity (pravděpodobně Cloudflare Turnstile nebo reCAPTCHA).  
   - **Řešení**:  
     - Integrujte **CAPTCHA resolver** (např. 2Captcha, Anti-Captcha) přímo do Playwright skriptu.  
     - Alternativně použijte **headless prohlížeč s emulací GPU** (např. Playwright s `--disable-gpu` odstraněným).

4. **Testování API**  
   - API nebylo nalezeno, ale může být skryté.  
   - **Postup**:  
     - Inspekce síťových žádostí v prohlížeči (Network tab) při procházení stránek.  
     - Hledejte žádosti typu `/api/listings` nebo `/wp-json/wp/v2/posts`.

5. **Alternativní strategie**  
   - Pokud bude přístup přes API nebo JS rendering nadále blokován:  
     - Použijte **RSS feed** (pokud existuje) nebo **web.archive.org** pro archivované data.  
     - Zvažte **screen scraping** s OCR (např. Tesseract) jako poslední možnost.

**Doporučený nástrojový řetězec**:  
`Playwright (residenční proxy) + CAPTCHA resolver + rotace User-Agentů`  

**Příklad kódu (Playwright)**:
```python
from playwright.sync_api import sync_playwright

with sync_playwright() as p:
    browser = p.chromium.launch(
        proxy={"server": "residential-proxy:port", "username": "user", "password": "pass"},
        args=["--disable-blink-features=AutomationControlled"]
    )
    page = browser.new_page()
    page.add_init_script("Object.defineProperty(navigator, 'webdriver', {get: () => undefined})")
    page.goto("https://www.nextreality.cz")
    # Čekejte na načtení dat
    page.wait_for_selector(".listing-item")
    # Scrapování...
```

**Poznámka**: Pravidelně testujte změny v struktuře portálu a přizpůsobujte strategii.