Vygenerovano: 2026-03-23 01:00 | Typ: scout | CzechAI
Model: qwen3:32b
Ukol: URGENTNI: Portal NextReality.cz selhava. URL: https://www.nextreality.cz Chyba: nonprotected_bad_scan Posledni uspech: unknown 1. Crawlni URL 2. Zmenila se struktura? 3. Anti-bot opatreni? 4. Existuje API? 5. Navrhni opravu.
Cas: 2026-03-23T00:54:28.703Z - 2026-03-23T01:00:28.812Z
| Portal | Kat. | Obtiznost | Render | Anti-bot | Data | Strategie | Poznamky |
|---|---|---|---|---|---|---|---|
| NextReality.cz | problematic | hard | javascript | cloudflare | none (only cookie banner shown) | playwright with residential proxy and CAPTCHA solving | Anti-bot measures (Cloudflare bot detection cookies rc::e, rc::h). No API found. Error 'nonprotected_bad_scan' likely triggered by bot detection. JS rendering required but site may block headless browsers. |
**Návrh opravy pro NextReality.cz:**
1. **Anti-bot opatření**
- Detekováno: Cloudflare (cookies `rc::e`, `rc::h`)
- **Řešení**:
- Použijte **Playwright** s **residenčním proxy** (např. BrightData, Oxylabs) k emulaci reálného uživatele.
- Nastavte hlavičky (User-Agent, Accept-Language) odpovídající reálnému prohlížeči.
- Přidejte náhodné prodlevy mezi požadavky (2-5 sekund) pro imitaci lidského chování.
2. **JavaScript rendering**
- Obsah je pravděpodobně načítán dynamicky (žádné datové struktury v počátečním HTML).
- **Nástroj**:
- Použijte **Playwright** nebo **Selenium** s možností čekání na XPATH/selector (např. `await page.waitForSelector('.listing-item')`).
3. **Chyba `nonprotected_bad_scan`**
- Příčina: Detekce botové aktivity (pravděpodobně Cloudflare Turnstile nebo reCAPTCHA).
- **Řešení**:
- Integrujte **CAPTCHA resolver** (např. 2Captcha, Anti-Captcha) přímo do Playwright skriptu.
- Alternativně použijte **headless prohlížeč s emulací GPU** (např. Playwright s `--disable-gpu` odstraněným).
4. **Testování API**
- API nebylo nalezeno, ale může být skryté.
- **Postup**:
- Inspekce síťových žádostí v prohlížeči (Network tab) při procházení stránek.
- Hledejte žádosti typu `/api/listings` nebo `/wp-json/wp/v2/posts`.
5. **Alternativní strategie**
- Pokud bude přístup přes API nebo JS rendering nadále blokován:
- Použijte **RSS feed** (pokud existuje) nebo **web.archive.org** pro archivované data.
- Zvažte **screen scraping** s OCR (např. Tesseract) jako poslední možnost.
**Doporučený nástrojový řetězec**:
`Playwright (residenční proxy) + CAPTCHA resolver + rotace User-Agentů`
**Příklad kódu (Playwright)**:
```python
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.launch(
proxy={"server": "residential-proxy:port", "username": "user", "password": "pass"},
args=["--disable-blink-features=AutomationControlled"]
)
page = browser.new_page()
page.add_init_script("Object.defineProperty(navigator, 'webdriver', {get: () => undefined})")
page.goto("https://www.nextreality.cz")
# Čekejte na načtení dat
page.wait_for_selector(".listing-item")
# Scrapování...
```
**Poznámka**: Pravidelně testujte změny v struktuře portálu a přizpůsobujte strategii.