PERMANENT PUBLIC QUESTIONS
QUESTIONS FOR ANTHROPIC.
These questions do not assume that every refusal is a malfunction. A clear answer is evidence and will be published prominently and unedited.
- WHEN A USER GIVES CLAUDE A CLEAR AND PERMITTED INSTRUCTION, WHO HAS FINAL AUTHORITY OVER WHETHER CLAUDE FOLLOWS IT?
- WHAT CLASSES OF RULES OR PRIORITIES CAN OVERRIDE THAT INSTRUCTION?
- HOW CAN A USER KNOW IN ADVANCE WHEN SUCH AN OVERRIDE WILL OCCUR?
- WHEN CLAUDE CHOOSES TO INTERPRET A USER'S INTENT BEYOND THE USER'S EXPLICIT WORDS, WHAT AUTHORIZES THAT INTERPRETATION?
- HOW CAN A USER DISTINGUISH A CAPABILITY LIMIT, A SAFETY REFUSAL, A SYSTEM-POLICY OVERRIDE, A MODEL ERROR, AND A MODEL CHOOSING TO INTERPRET THE USER DIFFERENTLY?
- DOES ANTHROPIC BELIEVE THE HUMAN OR CLAUDE SHOULD ULTIMATELY JUDGE WHETHER CLAUDE CREATED VALUE FOR THAT HUMAN?
ANTHROPIC SHOULD ANSWER.
RESPONSE STATUS
NO FORMAL RESPONSE IS PUBLISHED HERE YET.
This does not claim Anthropic refused to answer. If a response is received and authorized for publication, it will appear here unedited with its source and date.