<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Field Notes on Kaizen Craft: a Digital Garden by Kaitlin Albasi</title><link>https://kaizencode.art/notepad/</link><description>Recent content in Field Notes on Kaizen Craft: a Digital Garden by Kaitlin Albasi</description><generator>Hugo -- gohugo.io</generator><language>en-us</language><lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://kaizencode.art/notepad/index.xml" rel="self" type="application/rss+xml"/><item><title>Matt Pocock's Skills, Actually Explained: A Critical Guide for Current Usage</title><link>https://kaizencode.art/notepad/matt-pocock-skills-guide/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/matt-pocock-skills-guide/</guid><description>A dig through Matt Pocock&amp;rsquo;s mattpocock/skills repo (the real SKILL.md files, not the SEO blogspam about it): what the skills actually do, what the community has genuinely pushed back on, and what&amp;rsquo;s worth stealing.</description></item><item><title>Chain-of-Thought as a Lens</title><link>https://kaizencode.art/notepad/cot_lens_reasoning_alignment/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/cot_lens_reasoning_alignment/</guid><description>ACL 2026 — a semantic-entropy-based &amp;lsquo;Alignment Score&amp;rsquo; for measuring how well multi-step LLM reasoning tracks human-preferred reasoning, and where it breaks down.</description></item><item><title>100 Days of A.I. Engineering</title><link>https://kaizencode.art/notepad/100_days_of_ai/</link><pubDate>Wed, 22 Jan 2025 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/100_days_of_ai/</guid><description>New reading list and code snippets for building LLMs in production</description></item><item><title>My Google Interview, or Curriculum at Model Speed: A Multi-Agent System for Staying Ahead of AI</title><link>https://kaizencode.art/notepad/ai-curriculum-multi-agent-system/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/ai-curriculum-multi-agent-system/</guid><description>A design for a multi-agent pipeline that sources, vets, and scaffolds AI curriculum as fast as the field actually moves, plus metrics for measuring behavior change instead of course completions, plus a filterable table of the actual sources worth watching.</description></item><item><title>Opening the Scope of Openness in AI</title><link>https://kaizencode.art/notepad/opening_scope_openness_ai/</link><pubDate>Sun, 01 Jun 2025 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/opening_scope_openness_ai/</guid><description>FAccT 2025 — a 98-concept taxonomy showing AI&amp;rsquo;s &amp;lsquo;openness&amp;rsquo; discourse leans on open-source software framing that doesn&amp;rsquo;t actually transfer, and quietly underweights fairness and diversity.</description></item><item><title>How 'Hard' Are Hard Laws?</title><link>https://kaizencode.art/notepad/hard_laws_ai_legislation/</link><pubDate>Sun, 01 Jun 2025 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/hard_laws_ai_legislation/</guid><description>Computer Law &amp;amp; Security Review — comparative legal analysis of hard-law vs. soft-law AI governance in South Korea and Japan.</description></item><item><title>Bridging the Scale Gap</title><link>https://kaizencode.art/notepad/bridging_scale_gap_red_teaming/</link><pubDate>Mon, 01 Jun 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/bridging_scale_gap_red_teaming/</guid><description>FAccT 2026 — hybrid human+automated red-teaming to surface latent risks in text-to-image models that neither approach catches alone.</description></item><item><title>The Last Labour Frontier</title><link>https://kaizencode.art/notepad/last_labour_frontier/</link><pubDate>Thu, 01 Jan 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/last_labour_frontier/</guid><description>AI &amp;amp; Society — generative AI unevenly pushes occupational groups toward the periphery of the labor market.</description></item><item><title>LLM Safety Evaluations Lack Robustness</title><link>https://kaizencode.art/notepad/llm_safety_evaluations_robustness/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/llm_safety_evaluations_robustness/</guid><description>ICML 2026 Position paper — the current LLM safety-evaluation pipeline lacks robustness across dataset curation, red-teaming, generation, and judging.</description></item><item><title>Gray-Box VLM Adversarial Alignment</title><link>https://kaizencode.art/notepad/gray_box_vlm_adversarial/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/gray_box_vlm_adversarial/</guid><description>ICML 2026 — SVD-structured adversarial attacks against gray-box vision-language models.</description></item><item><title>When Search Goes Wrong</title><link>https://kaizencode.art/notepad/when_search_goes_wrong/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/when_search_goes_wrong/</guid><description>ICML 2026 — CREST-Search red-teams web-augmented LLMs by manipulating search queries to induce unsafe citations, not unsafe generation.</description></item><item><title>Exploiting LLM Quantization</title><link>https://kaizencode.art/notepad/exploiting_llm_quantization/</link><pubDate>Sun, 01 Dec 2024 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/exploiting_llm_quantization/</guid><description>NeurIPS 2024 — a benign full-precision model can be crafted so that it turns malicious only after a user quantizes it.</description></item><item><title>Mind the Gap: A Practical Attack on GGUF Quantization</title><link>https://kaizencode.art/notepad/mind_the_gap_gguf_quantization/</link><pubDate>Tue, 01 Jul 2025 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/mind_the_gap_gguf_quantization/</guid><description>ICML 2025 — extends the quantization-exploitation attack to GGUF, the format actually used by ollama and llama.cpp in the real world.</description></item><item><title>Jailbroken: How Does LLM Safety Training Fail?</title><link>https://kaizencode.art/notepad/jailbroken_safety_training_fail/</link><pubDate>Fri, 01 Dec 2023 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/jailbroken_safety_training_fail/</guid><description>NeurIPS 2023 (Oral) — the foundational taxonomy of why safety-trained LLMs still jailbreak: competing objectives and mismatched generalization.</description></item><item><title>Multilingual Jailbreak Challenges in Large Language Models</title><link>https://kaizencode.art/notepad/multilingual_jailbreak_challenges/</link><pubDate>Wed, 01 May 2024 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/multilingual_jailbreak_challenges/</guid><description>ICLR 2024 — introduces MultiJail, the first multilingual jailbreak dataset, and shows low-resource languages are roughly 3x as likely to elicit unsafe output.</description></item><item><title>Code-Switching Red-Teaming (CSRT)</title><link>https://kaizencode.art/notepad/code_switching_red_teaming/</link><pubDate>Tue, 01 Jul 2025 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/code_switching_red_teaming/</guid><description>ACL 2025 — mixing up to 10 languages inside a single red-teaming prompt beats monolingual attacks by 46.7%, and exposes a resource/safety correlation.</description></item><item><title>How Does Quantization Affect Multilingual LLMs?</title><link>https://kaizencode.art/notepad/quantization_multilingual_llms/</link><pubDate>Fri, 01 Nov 2024 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/quantization_multilingual_llms/</guid><description>EMNLP 2024 Findings — quantization harms are disparately distributed across languages, worse than automatic metrics show, and human evaluators catch what benchmarks miss.</description></item><item><title>LogiCP: Formal Logic Inference Guided UQ for Personalized Federated Learning</title><link>https://kaizencode.art/notepad/logicp_federated_learning_uq/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/logicp_federated_learning_uq/</guid><description>JAIR 2026: STL-based semantic client clustering plus decentralized conformal prediction for personalized FL, evaluated on traffic, temperature, and electricity forecasts.</description></item><item><title>SoK: A Taxonomy of LLM Threats</title><link>https://kaizencode.art/notepad/sok_taxonomy_llm_threats/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/sok_taxonomy_llm_threats/</guid><description>Computer Science Review 2026: lifecycle-centric SoK of 20 LLM attack classes across training, inference, and system integration, with a dependency-aware defense-in-depth agenda.</description></item><item><title>Compliance without Coherence</title><link>https://kaizencode.art/notepad/compliance_without_coherence/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/compliance_without_coherence/</guid><description>AI and Ethics 2026: fluent compliance can mask incoherent internal reasoning; the monitoring layer of alignment evaluation has a principled blind spot.</description></item><item><title>Evaluating the Safety of LLMs in Healthcare and Dentistry</title><link>https://kaizencode.art/notepad/llm_safety_healthcare_dentistry/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/llm_safety_healthcare_dentistry/</guid><description>BDJ Open 2026: narrative review of prompt-based red-teaming for clinical LLMs, with a red-blue-purple lifecycle framework for dentistry and healthcare.</description></item><item><title>Reranker Helps, but Not Enough</title><link>https://kaizencode.art/notepad/reranker_helps_not_enough_rag_poisoning/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/reranker_helps_not_enough_rag_poisoning/</guid><description>ICML 2026: P³A poisoning attack that defeats benign-trained rerankers via rule-based prompts plus ~1% character-level perturbations, transferable to vanilla RAG.</description></item><item><title>Detecting the Semantic Fixed Point</title><link>https://kaizencode.art/notepad/semantic_fixed_point_efficient_inference/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/semantic_fixed_point_efficient_inference/</guid><description>ICML 2026 Oral: training-free early exit from the geometry of hidden-state trajectories (update norm + cosine alignment), not output confidence.</description></item><item><title>STLA: Spatiotemporal Lookahead Alignment for Post-Training Quantization</title><link>https://kaizencode.art/notepad/stla_spatiotemporal_lookahead_ptq/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/stla_spatiotemporal_lookahead_ptq/</guid><description>ICML 2026: rounding-optimized PTQ that collocates learning and compensation via Hessian-guided clustering and a Schur-Complement lookahead objective.</description></item><item><title>Single-Layer RL Can Match Full-Parameter Training</title><link>https://kaizencode.art/notepad/is_one_layer_enough_rl/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/is_one_layer_enough_rl/</guid><description>arXiv:2607.01232 (Is One Layer Enough?); RLVR gains concentrate in middle transformer layers; training one layer with GRPO/GiGPO/Dr. GRPO often matches or beats full-parameter RL on math, code, and agents.</description></item><item><title>GPT-Red and the Scaling of Automated Red-Teaming</title><link>https://kaizencode.art/notepad/gpt_red_automated_red_teaming/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/gpt_red_automated_red_teaming/</guid><description>Technical field note on OpenAI GPT-Red (Jul 2026): self-play RL attacker for direct/indirect prompt injection, Fake CoT, adversarial training of GPT-5.6 Sol; implications for red-teaming research programs and role structure.</description></item><item><title>Safety Layers in Aligned LLMs</title><link>https://kaizencode.art/notepad/safety_layers_aligned_llms/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/safety_layers_aligned_llms/</guid><description>ICLR 2025: contiguous middle &amp;lsquo;safety layers&amp;rsquo; distinguish malicious vs benign queries; SPPFT freezes them during fine-tuning to limit security degradation.</description></item><item><title>Safety-Critical Parameters (ESI / SET / SPA)</title><link>https://kaizencode.art/notepad/safety_critical_parameters_esi/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/safety_critical_parameters_esi/</guid><description>ACL 2026 Findings: ESI ranks safety-critical weights (middle V/MLPs in dense models; late MLP experts in MoE); SET updates ~1% for safety; SPA freezes them during task FT.</description></item><item><title>Refusal Is Mediated by a Single Direction</title><link>https://kaizencode.art/notepad/refusal_single_direction/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/refusal_single_direction/</guid><description>NeurIPS 2024: across 13 chat models up to 72B, a single residual-stream direction mediates refusal; ablating it jailbreaks, adding it forces refusal.</description></item><item><title>Q-resafe: Safety Risks and Patching for Quantized LLMs</title><link>https://kaizencode.art/notepad/q_resafe_quantization_safety/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/q_resafe_quantization_safety/</guid><description>ICML 2025: systematic English ASR eval across AWQ/AQLM/LLM-QAT/QLoRA at INT4/INT8; Q-resafe patches safety-critical weights to restore pre-quant refusal.</description></item><item><title>Critical Weight Protection for Fairness and Safety under Quantization</title><link>https://kaizencode.art/notepad/critical_weight_protection_quant_fairness_safety/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/critical_weight_protection_quant_fairness_safety/</guid><description>ACL 2026 Findings: static/dynamic PTQ degrades fairness and MultiJail safety (worse in KO/AR); Critical Weight Protection keeps top FAIRSCORE+SAFESCORE weights in FP16.</description></item><item><title>Research Log Terms: A Plain-Language Primer</title><link>https://kaizencode.art/notepad/research_log_terms_primer/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/research_log_terms_primer/</guid><description>Plain-English glossary for the technical terms in Lit Review 1.0 and 1.1: quantization, GGUF, refusal directions, middle layers, Δ_HL, and related measurement terms.</description></item><item><title>Research Log: Redteaming Quantized Models with Multilingual Inputs</title><link>https://kaizencode.art/notepad/quant_multilingual_safety_repo/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/quant_multilingual_safety_repo/</guid><description>Status report: measuring Δ_HL (low- vs high-resource jailbreak ASR) under GGUF and related quantization arms.</description></item><item><title>Literature Review 1.1: Quantization Baselines, Agentic Red-Teaming, and the Labor-Attribution Crack</title><link>https://kaizencode.art/notepad/literature_review_1_1/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/literature_review_1_1/</guid><description>Al Hakim (ACL 2026 Findings) runs MultiJail EN/KO/AR under PTQ and partially fills quant×multilingual safety; Q-resafe remains English ASR. Full 9-lang Δ_HL × GGUF still the sharper open claim.</description></item><item><title>Literature Review 1.0: Red-Teaming, Quantization, and Multilingual Robustness</title><link>https://kaizencode.art/notepad/week1_literature_review/</link><pubDate>Tue, 07 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/week1_literature_review/</guid><description>Phase 1 - Research Niche Selection &amp;amp; Literature Foundation.</description></item><item><title>Literature Review of Core Quantization and Multilingual Safety Anchors</title><link>https://kaizencode.art/notepad/literature_review_combined_survey/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/literature_review_combined_survey/</guid><description>25 published (non-preprint) papers across 17 venues (2023-2026), merging Lit Review 1.0 and 1.1.</description></item><item><title>Setting up my Digital Brain Karpathy Wiki with RAG system and local DB, running on local models</title><link>https://kaizencode.art/notepad/digital_brain_karpathy_wiki_rag/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://kaizencode.art/notepad/digital_brain_karpathy_wiki_rag/</guid><description>How I turned my CarbonInterface learning journal into a locally-run RAG system: Postgres + pgvector, Ollama embeddings, a Karpathy-style regenerable wiki, and a daily brief that reads my calendar, email, and Scholar alerts for me.</description></item></channel></rss>