AI Automation, Evaluation & Data Engineer
Current- Designed and shipped end-to-end AI-powered automation workflows for content, research, and data pipelines — cutting manual effort by over 60% across active accounts.
- Built and iterated on multi-agent LLM systems (LangGraph, LlamaIndex), orchestrating retrieval, reasoning, and fact-checking agents.
- Evaluated large-scale AI/ML outputs for instruction-following, factual accuracy, safety, and bias across bilingual Arabic–English datasets, using rubric-based scoring (Accuracy, Precision, Recall, F1).
- Authored adversarial edge-case prompts and Golden Responses for alignment workflows; delivered structured evaluation reports supporting iterative model improvement.
















