98 lines
4.1 KiB
Python
98 lines
4.1 KiB
Python
import argparse
|
|
from pathlib import Path
|
|
|
|
from .core.config import Settings, parse_listing_segments
|
|
from .core.utils import save_to_json
|
|
from .scraper import DUBIZZLEScraper
|
|
|
|
|
|
def build_parser() -> argparse.ArgumentParser:
|
|
parser = argparse.ArgumentParser(description="Dubizzle scraper CLI")
|
|
parser.add_argument("--headless", choices=["true", "false"], default=None, help="Override headless mode")
|
|
parser.add_argument("--debug", action="store_true", help="Enable DEBUG logging")
|
|
subparsers = parser.add_subparsers(dest="command", required=True)
|
|
|
|
default_output_dir = Path("artifacts/json")
|
|
|
|
subparsers.add_parser("init-db", help="Create DB tables")
|
|
|
|
listing_parser = subparsers.add_parser("collect-listing", help="Collect vehicle URLs from listing page")
|
|
listing_parser.add_argument("--make", default=None)
|
|
listing_parser.add_argument("--model", default=None)
|
|
listing_parser.add_argument("--output", default=str(default_output_dir / "dubizzle_listing_links.json"))
|
|
|
|
scrape_parser = subparsers.add_parser("scrape-vehicle", help="Scrape a vehicle detail page")
|
|
scrape_parser.add_argument("vehicle_url")
|
|
scrape_parser.add_argument("--output", default=str(default_output_dir / "dubizzle_vehicle_detail.json"))
|
|
|
|
sync_vehicle_parser = subparsers.add_parser("sync-vehicle", help="Scrape + upsert one vehicle")
|
|
sync_vehicle_parser.add_argument("vehicle_url")
|
|
sync_vehicle_parser.add_argument("--lane", default="dubizzle")
|
|
sync_vehicle_parser.add_argument("--output", default=str(default_output_dir / "dubizzle_sync_vehicle.json"))
|
|
|
|
sync_listing_parser = subparsers.add_parser("sync-listing", help="Collect listing + sync all vehicles")
|
|
sync_listing_parser.add_argument("--make", default=None)
|
|
sync_listing_parser.add_argument("--model", default=None)
|
|
sync_listing_parser.add_argument("--lane", default="dubizzle_cars")
|
|
sync_listing_parser.add_argument("--limit", type=int, default=None)
|
|
sync_listing_parser.add_argument("--only-new", choices=["true", "false"], default=None)
|
|
sync_listing_parser.add_argument("--output", default=str(default_output_dir / "dubizzle_sync_listing.json"))
|
|
|
|
return parser
|
|
|
|
|
|
def main() -> None:
|
|
parser = build_parser()
|
|
args = parser.parse_args()
|
|
|
|
runtime_settings: Settings | None = None
|
|
if args.headless is not None or args.debug:
|
|
runtime_settings = Settings()
|
|
if args.headless is not None:
|
|
runtime_settings.headless = args.headless == "true"
|
|
if args.debug:
|
|
runtime_settings.log_level = "DEBUG"
|
|
|
|
with DUBIZZLEScraper(runtime_settings) as scraper:
|
|
if args.command == "init-db":
|
|
data = scraper.init_db()
|
|
print(f"DB initialized: {data}")
|
|
return
|
|
elif args.command == "collect-listing":
|
|
data = scraper.collect_listing(make=args.make, model=args.model)
|
|
elif args.command == "scrape-vehicle":
|
|
data = scraper.scrape_vehicle_detail(args.vehicle_url)
|
|
elif args.command == "sync-vehicle":
|
|
data = scraper.sync_vehicle(args.vehicle_url, lane=args.lane)
|
|
else:
|
|
only_new = None if args.only_new is None else args.only_new == "true"
|
|
segments = parse_listing_segments(scraper.settings.listing.listing_segments_json)
|
|
use_segmented = (
|
|
bool(segments)
|
|
and args.make is None
|
|
and args.model is None
|
|
and args.limit is None
|
|
and scraper.settings.discovery.mode in {"listing", "algolia"}
|
|
)
|
|
if use_segmented:
|
|
data = scraper.sync_listing_segmented(
|
|
segments=segments,
|
|
lane=args.lane,
|
|
only_new=only_new,
|
|
)
|
|
else:
|
|
data = scraper.sync_listing(
|
|
make=args.make,
|
|
model=args.model,
|
|
lane=args.lane,
|
|
limit=args.limit,
|
|
only_new=only_new,
|
|
)
|
|
|
|
save_to_json(data, Path(args.output))
|
|
print(f"Saved to {Path(args.output).resolve()}")
|
|
|
|
|
|
if __name__ == "__main__":
|
|
main()
|