Skip to content

Mark baumann patch 1 - #867

Closed
mark-baumann wants to merge 21 commits into
OpenPipe:mainfrom
mark-baumann:mark-baumann-patch-1
Closed

Mark baumann patch 1#867
mark-baumann wants to merge 21 commits into
OpenPipe:mainfrom
mark-baumann:mark-baumann-patch-1

Conversation

@mark-baumann

Copy link
Copy Markdown

No description provided.

mark-baumann and others added 21 commits July 28, 2026 23:17
- reward_model.py: Regelbasiertes + modellbasiertes Reward-Modell für Agent-Bewertung
- train_agent.py: GRPO-Training mit LoRA für Qwen/Llama (CLI + API)
- GRPO_TRAINING.md: Dokumentation und Schnellstart-Anleitung
- pyproject.toml: uv required-version auf >=0.11.6 gesenkt (Kompatibilität)
…und Konfiguration hinzugefügt

- train_agent.py: Ungenutzte Imports (annotations, dataclass, Path, load_dataset, TrainingArguments, LocalGRPOConfig) entfernt
- reward_model.py: Ungenutzte TYPE_CHECKING-Imports (PreTrainedModel, PreTrainedTokenizer) entfernt
- tests/unit/test_reward_model.py: 24 Unit-Tests für AgentRewardModel, create_reward_function und RewardModelWrapper
- tests/unit/test_grpo_config.py: 19 Unit-Tests für ModelConfig, LoRAConfig, GRPOConfig, RewardConfig, DataConfig, TrainingConfig und Preset-Configs
- Alle 43 Tests bestanden (1 skipped wegen fehlendem torch)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant